【发布时间】:2018-05-27 08:46:49
【问题描述】:
我有一个数据框(通过从 azure 中的多个 blob 加载创建),其中有一列是 ID 列表。 现在,我想要整个列中的唯一 ID 列表:
这是一个例子 -
df -
| col1 | col2 | col3 |
| "a" | "b" |"[q,r]"|
| "c" | "f" |"[s,r]"|
这是我预期的回应:
resp = [q, r, s]
知道怎么去那里吗?
我目前的方法是将 col3 中的字符串转换为 python 列表,然后可能会以某种方式将它们展平。
但到目前为止我还不能这样做。我尝试在 pyspark 中使用用户定义的函数,但它们只返回字符串而不是列表。
FlatMaps 仅适用于 RDD,而不适用于 Dataframe,因此它们不适用。
也许有办法在从 RDD 到数据帧的转换过程中指定这一点。但不知道该怎么做。
【问题讨论】:
标签: python dataframe pyspark spark-dataframe rdd