【发布时间】:2021-10-01 22:52:49
【问题描述】:
首先 - 我很迷茫,我什至不知道如何表达/命名我的问题。
我的第一个数据框是键值对,我用一些简单的代码将其转出,它为我提供了您可以在图 1 中看到的数据框:
df = df.groupBy("ID", "SUBID").pivot("SOURCE", fields).agg(first(F.col("VALUE")))
它有我想要的,但我认为我需要再次分组或合并或 某事 以获得我想要的结果,图 2..
我尝试了一些方法,但似乎都没有。对我来说唯一有意义的是我需要另一个 group by 或某种自我加入?
我想要的结果(据我所知,这都是针对同一个人 [ID])将类似于以下内容...相同的Name 已被全面应用,相同的surname,相同的@987654329 @ 等。包含值的单元格将保留其当前值。
请寻求任何建议或重复问题。
【问题讨论】:
-
你想用默认值完成吗?还是来自另一行的值?当其中已经有几个值时会发生什么?你选哪一个。
标签: python pyspark apache-spark-sql