【发布时间】:2021-05-21 10:45:42
【问题描述】:
我有以下名为“数据”的数据集:
+---------+-------------+------+
| name | subject| mark |
+---------+-------------+------+
| Anna| math| 80|
| Vlad| history| 67|
| Jack| art| 78|
| David| math| 71|
| Monica| art| 65|
| Alex| lit| 59|
| Mark| math| 82|
+---------+-------------+------+
我想做一个 map-reduce 工作。
结果显示如下或类似:
Anna, David : 1
Anna, Mark : 1
David, mark: 1
Vlad, None : 1
Jack, Monica: 1
Alex, None : 1
我已尝试执行以下操作:
new_data = data.select(['name', 'subject']).show()
+---------+-------------+
| name | subject|
+---------+-------------+
| Anna| math|
| Vlad| history|
| Jack| art|
| David| math|
| Monica| art|
| Alex| lit|
| Mark| math|
+---------+-------------+
data_new.groupBy('name','subject').count().show(10)
但是,这个命令并没有提供我需要的东西。
【问题讨论】:
标签: sql dataframe apache-spark pyspark apache-spark-sql