【发布时间】:2016-12-27 12:38:22
【问题描述】:
我的问题与PySpark reduceByKey on multiple values 类似,但有一些关键的区别。我是 PySpark 的新手,所以我肯定会遗漏一些明显的东西。
我有一个具有以下结构的 RDD:
(K0, ((k01,v01), (k02,v02), ...))
....
(Kn, ((kn1,vn1), (kn2,vn2), ...))
我想要的输出类似于
(K0, v01+v02+...)
...
(Kn, vn1+vn2+...)
这似乎是使用reduceByKey 的完美案例,起初我想到了类似的东西
rdd.reduceByKey(lambda x,y: x[1]+y[1])
这正是我开始时的 RDD。我想我的索引有问题,因为有嵌套的元组,但我已经尝试了我能想到的所有可能的索引组合,并且它不断给我返回初始 RDD。
是否有它不应该与嵌套元组一起使用的原因,或者我做错了什么?
【问题讨论】: