【发布时间】:2018-10-15 09:19:38
【问题描述】:
我想看看我们是否可以使用 spark/scala 从 dataFrame 中的一列中的值创建新列。 我有一个包含以下数据的数据框
df.show()
+---+-----------------------+
|id |allvals |
+---+-----------------------+
|1 |col1,val11|col3,val31 |
|3 |col3,val33|col1,val13 |
|2 |col2,val22 |
+---+-----------------------+
在上面的数据中 col1/col2/col3 是列名后跟它的值。列名和值由, 分隔。每组由|分隔。
现在,我想实现这样的目标
+---+----------------------+------+------+------+
|id |allvals |col1 |col2 |col3 |
+---+----------------------+------+------+------+
|1 |col1,val11|col3,val31 |val11 |null |val31 |
|3 |col3,val33|col1,val13 |val13 |null |val13 |
|2 |col2,val22 |null |val22 |null |
+---+----------------------+------+------+------+
感谢任何帮助。
【问题讨论】:
标签: scala apache-spark spark-dataframe