【问题标题】:How to compare the performance of two spark streaming jobs?如何比较两个火花流作业的性能?
【发布时间】:2019-12-04 09:50:53
【问题描述】:

我的 Spark 作业正在使用来自 kafka 主题的数据并执行一些操作。区别在于序列化,一个是使用java序列化,一个是使用kryo序列化。如何比较这两个流式作业,因为它们在同一时间间隔内每秒输入的数量不同,输入批量大小也不同?

【问题讨论】:

    标签: scala apache-spark serialization apache-kafka


    【解决方案1】:

    我会说您需要计算处理单个输入所需的时间。

    假设您获得了包含 1000 条记录的批次。测量整个处理时间并除以 1000。您得到单条记录的处理时间。 收集多批次的信息,然后比较结果。

    【讨论】:

    • 一个批次有1000条记录,一个工作需要20秒,另一个工作需要21秒,现在有下一批有900条记录或999条记录等等,现在是处理时间有一次它比另一个低一点,反之亦然,在随机的时间间隔内。如果我需要手动计算,有没有其他方法@Vladislav Varslavans
    • 为什么要手动?你可以写一个代码来为你做这件事。然后将结果打印到日志中。你也可能对有状态的转换感兴趣 - techvidvan.com/tutorials/…
    猜你喜欢
    • 2015-12-11
    • 2017-01-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-01-17
    • 2020-03-10
    • 1970-01-01
    • 2020-05-23
    相关资源
    最近更新 更多