【发布时间】:2016-10-15 02:37:04
【问题描述】:
关于 Kafka 主题分区 -> 火花流资源利用,我想更清楚一些用例。
我使用 spark 独立模式,所以我只有“执行器总数”和“执行器内存”。据我所知并根据文档,将并行性引入 Spark 流的方法是使用分区的 Kafka 主题 -> 当我使用 spark-kafka 直接流集成时,RDD 将具有与 kafka 相同数量的分区。
因此,如果我在主题中有 1 个分区和 1 个执行器核心,则该核心将按顺序从 Kafka 中读取。
如果我有会发生什么:
主题中有 2 个分区,只有 1 个执行器核心?该核心会先从一个分区读取,然后再从第二个分区读取,因此对主题进行分区没有任何好处?
主题中有 2 个分区和 2 个核心?那么 1 个执行器核心会从 1 个分区读取,而第二个核心会从第二个分区读取吗?
1 个 kafka 分区和 2 个执行器核心?
谢谢。
【问题讨论】:
标签: apache-spark apache-kafka spark-streaming