【发布时间】:2016-03-01 16:26:25
【问题描述】:
输入 1: KV 数据流。
输入 2: 一些静态数据分区(用于处理输入 1 中的流)
问题可以建模为下图:
与 HDFS/RDD 分区共存: 我们如何确保流式任务 Map1、Map2 和 Map3 在以下机器上运行HDFS/RDD 分区是否存在?
图像描述:假设 K 是流式键(不是元组)。 First Map 将其转换为元组(具有空值)并将其广播到 3 个 Mapper。每个映射器都运行在包含不同分区的 RDD(或 HDFS 文件,这是第二个输入和静态数据)的不同节点上。每个 Mapper 使用 RDD 分区来计算键的值。最后我们要为键聚合值(使用reduceByKey _+_)。
【问题讨论】:
标签: hadoop apache-spark stream spark-streaming flink-streaming