【发布时间】:2019-12-04 09:50:53
【问题描述】:
我的 Spark 作业正在使用来自 kafka 主题的数据并执行一些操作。区别在于序列化,一个是使用java序列化,一个是使用kryo序列化。如何比较这两个流式作业,因为它们在同一时间间隔内每秒输入的数量不同,输入批量大小也不同?
【问题讨论】:
标签: scala apache-spark serialization apache-kafka
我的 Spark 作业正在使用来自 kafka 主题的数据并执行一些操作。区别在于序列化,一个是使用java序列化,一个是使用kryo序列化。如何比较这两个流式作业,因为它们在同一时间间隔内每秒输入的数量不同,输入批量大小也不同?
【问题讨论】:
标签: scala apache-spark serialization apache-kafka
我会说您需要计算处理单个输入所需的时间。
假设您获得了包含 1000 条记录的批次。测量整个处理时间并除以 1000。您得到单条记录的处理时间。 收集多批次的信息,然后比较结果。
【讨论】: