【发布时间】:2016-03-14 06:09:48
【问题描述】:
我想了解接收器在 Spark Streaming 中的工作原理。据我了解,将有一个接收器任务在执行器中运行,收集数据并保存为 RDD。调用 start() 时接收器开始读取。需要澄清以下内容。
- Spark Streaming 作业启动多少个接收器?多个还是一个?
- 接收器是基于推送还是基于拉取?
- 在任何情况下接收器都会成为瓶颈吗?
- 为实现并行度,应在工作节点之间对数据进行分区。因此,对于流式数据,数据是如何在节点之间分布的。
- 如果新节点上基于批处理时间间隔形成一个新的RDD,那么SparkContext在Job提交后如何将transform函数序列化到节点上?
- 可以通过参数控制接收器的发射数量吗?
想了解 Spark Streaming 和接收器的结构。
【问题讨论】:
-
您指的是哪些接收器? Kafka 你的数据源是什么?
-
@YuvalItzchakov 它可以是任何接收器。我想了解接收器在流媒体中的工作原理。
-
我不确定 Kinesis 接收器是否与 Kafka 接收器相同。如果我理解您的意思,底层消息代理可以确定不同的语义。
标签: apache-spark spark-streaming