【发布时间】:2018-09-15 11:44:56
【问题描述】:
我正在尝试构建 Kafka 并触发流式传输用例。其中,Spark Streaming 正在使用来自 Kafka 的流。我们正在增强流并将增强的流存储到一些目标系统中。
我的问题是,在 yarn-cluster 或 yarn-client 模式下运行 spark 流作业有意义吗? (这里不涉及Hadoop)
我认为 Spark 流式作业应该只运行本地模式,但另一个问题是如何提高 Spark 流式作业的性能。
谢谢,
【问题讨论】:
-
您的用例是什么?数据量?有很多参数需要考虑。如果您计划从 Kafka 读取数据,请运行一些扩充或 SQL 聚合,每个用例都有不同的配置参数来提高 Spark Streaming 的性能。
标签: apache-spark apache-kafka spark-streaming spark-streaming-kafka