写在前面

本文隶属于专栏《100个问题搞定大数据理论体系》,该专栏为笔者原创,引用请注明来源,不足和错误之处请在评论区帮忙指出,谢谢!

本专栏目录结构和文献引用请见100个问题搞定大数据理论体系

解答

事件时间指的是一个数据实际产生的时间点,而处理时间指的是处理数据的系统架构实际接收到这个数据的时间点。

补充

批处理中,通常关心更多的是事件时间。

举个例子,你在每年年初所看到的“支付宝年账单”就是一个数据批处理的典型例子。
支付宝会将我们在过去一年中的消费数据存储起来,并作为批处理输入,提取出过去一年中产生交易的事件时间,然后经过一系列业务逻辑处理,得到各种有趣的信息作为输出。

而流处理中是关心数据的事件时间还是处理时间,将视具体的应用场景而定。

例如,像网页监控系统这样的流处理系统要计算网站的QPS,它所关心的更多是处理时间,也就是网页请求数据被监控系统接收到的时间,从而计算QPS。
而在一些医疗护理监控系统的流处理系统中,他们则更关心数据的事件时间,这种系统不会因为接收到的数据有网络延时,而忽略数据本来产生的时间。

Q.E.D.


大数据开发工程师,精通 Spark,擅长 Java 和 Scala