【问题标题】:Disadvantages/Problems with using Apache Beam instead of using Spark directly? [closed]使用 Apache Beam 而不是直接使用 Spark 的缺点/问题? [关闭]
【发布时间】:2019-04-29 16:21:06
【问题描述】:

我需要开始一个新项目,不知道是Spark还是Flink更好。目前,该项目需要微批处理,但以后可能还需要流事件处理。

假设 Spark 是最好的,使用 Beam 并选择 Spark/Flink 作为运行器/引擎有什么缺点吗?

Beam 是否会增加任何开销或缺少 Spark/Flink 中可用的某些 API/功能?

【问题讨论】:

  • 这是一个非常好的问题。您能否在 user@beam.apache.org 中提问,因为那里有开发 Spark 和 Flink 运行器的 Beam 开发人员。他们有专业知识来回答“Beam 是否会增加任何开销或缺少 Spark/Flink 中可用的某些 API/功能?”。
  • 我刚刚将它发送到该邮件列表。谢谢!

标签: apache-spark apache-flink apache-beam


【解决方案1】:

回答部分问题:

首先,Beam 定义了 API 来编程进行数据处理。要采用它,您必须首先了解它的编程模型,并确保它的模型适合您的需求。

假设您已经充分了解 Beam 可以为您提供什么帮助,并且您计划选择 Spark 作为执行运行器,您可以查看运行器能力矩阵[1],了解 Spark 上的 Beam API 支持。

关于在 Spark 上运行 Beam 的开销。您可能需要在 user@beam.apache.org 或 dev@beam.apache.org 中询问。 Runner 开发人员可以对此有更好的答案。

[1]https://beam.apache.org/documentation/runners/capability-matrix/

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-03-05
    • 1970-01-01
    • 2023-04-06
    • 2016-05-17
    • 1970-01-01
    • 2018-09-22
    • 2016-12-17
    相关资源
    最近更新 更多