【发布时间】:2016-04-16 22:49:46
【问题描述】:
我是 Spark 和 Map Reduce 的初学者,据我了解 spark aggregate(ByKey) 方法遵循 map reduce 模式,我希望有人帮我确认它是否正确。
- 第一个函数参数“segFunc”获取每个键的数据 并为每个键并行运行。就像地图中的 map() 减少。
- 第二个函数参数“combFun”收集数据 对于每个键,即使跨分区,它也不是并行运行的 并且系统保证了这个联合收割机的同步 所有键之间的功能。就像 map reduce 中的 combiner()。
请指正,非常感谢。
【问题讨论】:
标签: java scala concurrency apache-spark mapreduce