【发布时间】:2021-10-05 12:22:56
【问题描述】:
我正在寻找有关 Pyspark 数据框的帮助,其中包含这样一个列:
| Value |
|---|
| id1:xxx1xxx |
| id2:666x666 |
| id1:xxx4xxx||id2:555x555||id1:xxx5xxx |
我想要创建一个附加列,其中这些值位于结构数组中。这样做的目的是与另一个数据框的值匹配。我希望这个问题在任何方面都有意义。
已经能够将数据框列转换为以下内容:
["id1:xxx7xxx", "id2:777l777", "id1:999xx99"]
关于如何将其转换为结构化数组的任何建议?
谢谢
【问题讨论】:
-
你能分享你想要的格式吗?此外,在第三行中,我看到“id1”出现了两次。是故意的吗?
-
感谢您的帮助。我想要的是一个带有标签元素的结构化数组。所以基本上是结构化数组中列出的所有 ID 类型。像这样:[{"id1":["fff6x666","555k999"],"id2":6666,"id3":["kkk7kkk",666k999]
-
希望上面的内容现在更有意义了吗?