【发布时间】:2018-05-25 01:54:26
【问题描述】:
我正在深入研究 Spark,但我对 Spark 如何处理某些事情有疑问。
假设我有一个键 -> 值对的 RDD:(CustomerID, TotalSpend)。如果我在 RDD 上使用 .sortBy,因为 .sortBy 是 Scala 方法而不是 Spark 方法,我是否错过了 Spark 魔法?
换句话说,为了从 Spark 的分发中受益,你可以只在 RDD 上使用 Spark 方法吗?我已经看到人们想要执行以下操作的示例: rdd.sortBy(x => x._2) 但他们会首先映射 rdd 以反转元组成员,然后使用 rdd.reduceByKey()。
【问题讨论】:
标签: scala apache-spark rdd