【发布时间】:2020-12-17 18:27:08
【问题描述】:
我有一个 PySpark 数据框-
df = spark.createDataFrame([
("u1", 0),
("u2", 0),
("u3", 1),
("u4", 2),
("u5", 3),
("u6", 2),],
['user_id', 'medals'])
df.show()
输出-
+-------+------+
|user_id|medals|
+-------+------+
| u1| 0|
| u2| 0|
| u3| 1|
| u4| 2|
| u5| 3|
| u6| 2|
+-------+------+
我想获取所有用户的 奖牌 列的分布情况。因此,如果 medals 列中有 n 个唯一值,我希望输出数据框中的 n 列具有相应数量的获得那么多奖章的用户。
上面给出的数据的输出应该看起来像-
+------- +--------+--------+--------+
|medals_0|medals_1|medals_2|medals_3|
+--------+--------+--------+--------+
| 2| 1| 2| 1|
+--------+--------+--------+--------+
我如何做到这一点?
【问题讨论】:
标签: python-3.x pyspark apache-spark-sql pyspark-dataframes