【发布时间】:2016-09-13 04:28:28
【问题描述】:
我有一个如下所示的 Rdd
val m = sc.parallelize(Seq(("a",("x",1)), ("a",("y",2)), ("a",("z",2)), ("b",("x",1)),("b",("y",2))))
我使用下面的 groupByKey 转换了上面的 Rdd
val b = m.groupByKey.mapValues( _.toList)
结果:
(a,List((x,1), (y,2), (z,2)))
(b,List((x,1), (y,2)))
现在,我想过滤每个列表中具有最大值的元组 所以预期的结果是
(a,List((y,2), (z,2)))
(b,List((y,2)))
【问题讨论】:
标签: scala apache-spark rdd