【发布时间】:2019-10-21 13:04:46
【问题描述】:
假设我有一个如下所示的数据集 df
col1 col2
1 A
1 B
1 C
2 B
2 B
2 C
我想使用 col1 的数据集并使用以下代码将 col2 作为数组
var df2=df.groupBy("col1").agg(collect_set("col2").alias("col2"))
那么 df2 将是
COl1 Col2
1 A,B,C
2 B,C
如何更改代码以便我可以拥有
COl1 Col2
1 A,B,C
2 B,B,C
【问题讨论】:
标签: scala apache-spark dataframe databricks