【发布时间】:2022-01-24 02:48:27
【问题描述】:
我有一个包含许多列的数据集,如下所示:(Columns -name, timestamp, platform, clickcount, id)
Joy 2021-10-10T10:27:16 apple 5 1
May 2020-12-12T22:28:08 android 6 2
June 2021-09-15T20:20:06 Microsoft 9 3
Joy 2021-09-09T09:30:09 android 10 1
May 2021-08-08T05:05:05 apple 8 2
我想按 id 分组,之后应该是这样的
Joy 2021-10-10T10:27:16,2021-09-09T09:30:09 apple,android 5,10 1
May 2020-12-12T22:28:08,2021-08-08T05:05:05 android,apple 6,8 2
June 2021-09-15T20:20:06 Microsoft 9 3
在调用另一个将 id 转换为伪 id 的 Api 后,我想映射该 id 并使其看起来像
Joy 2021-10-10T10:27:16,2021-09-09T09:30:09 apple,android 5,10 1 A12
May 2020-12-12T22:28:08,2021-08-08T05:05:05 android,apple 6,8 2 B23
June 2021-09-15T20:20:06 Microsoft 9 3 C34
我已尝试使用 groupBy 和 forEach,但我被卡住了,无法继续进行
【问题讨论】:
标签: scala apache-spark aggregate-functions