【发布时间】:2019-09-23 11:59:07
【问题描述】:
基本上,我有一个如下所示的数据框:
+----+-------+------+------+
| id | index | col1 | col2 |
+----+-------+------+------+
| 1 | a | a11 | a12 |
+----+-------+------+------+
| 1 | b | b11 | b12 |
+----+-------+------+------+
| 2 | a | a21 | a22 |
+----+-------+------+------+
| 2 | b | b21 | b22 |
+----+-------+------+------+
我想要的输出是这样的:
+----+--------+--------+--------+--------+
| id | col1_a | col1_b | col2_a | col2_b |
+----+--------+--------+--------+--------+
| 1 | a11 | b11 | a12 | b12 |
+----+--------+--------+--------+--------+
| 2 | a21 | b21 | a22 | b22 |
+----+--------+--------+--------+--------+
所以基本上我想在分组id 之后将index 列“分解”成新列。顺便说一句,id 的计数是相同的,并且每个 id 具有相同的一组 index 值。我正在使用 pyspark。
【问题讨论】:
-
您想对列名 col1_a 和 col1_b 进行硬编码,否则它将是动态的并取决于索引的不同值?
-
它应该取决于
index的不同值
标签: apache-spark pyspark