【发布时间】:2016-10-09 11:53:29
【问题描述】:
我想知道是否有某种方法可以为 Spark 数据帧指定自定义聚合函数。如果我有一个包含 2 列 id 和 value 的表,我想 groupBy id 并将值聚合到每个 value 的列表中,如下所示:
来自:
john | tomato
john | carrot
bill | apple
john | banana
bill | taco
到:
john | tomato, carrot, banana
bill | apple, taco
这在数据帧中可行吗?我在询问数据框,因为我正在将数据作为 orc 文件读取,并且它作为数据框加载。我认为将其转换为 RDD 效率低下。
【问题讨论】:
标签: scala apache-spark group-by apache-spark-sql aggregate-functions