【发布时间】:2020-03-09 21:15:03
【问题描述】:
我在 spark 中有一个以下数据框 (df)
| group_1 | group_2 | year | value |
| "School1" | "Student" | 2018 | name_aaa |
| "School1" | "Student" | 2018 | name_bbb |
| "School1" | "Student" | 2019 | name_aaa |
| "School2" | "Student" | 2019 | name_aaa |
我想要的是
| group_1 | group_2 | values_map |
| "School1" | "Student" | [2018 -> [name_aaa, name_bbb], [2019 -> [name_aaa] |
| "School2" | "Student" | [2019 -> [name_aaa] |
我用groupBy 和collect_list() 和map() 尝试过,但没有成功。它创建了一个只有来自name_aaa 或name_bbb 的最后一个值的映射。如何使用 Apache Spark 实现这一目标?
【问题讨论】:
标签: scala apache-spark apache-spark-sql