【发布时间】:2016-05-13 10:06:04
【问题描述】:
我有一个类似于这个例子的DataFrame:
Timestamp | Word | Count
30/12/2015 | example_1 | 3
29/12/2015 | example_2 | 1
28/12/2015 | example_2 | 9
27/12/2015 | example_3 | 7
... | ... | ...
我想通过“word”列的值分割这个数据框,以获得 DataFrame 的“列表”(在下一步中绘制一些数字)。例如:
DF1
Timestamp | Word | Count
30/12/2015 | example_1 | 3
DF2
Timestamp | Word | Count
29/12/2015 | example_2 | 1
28/12/2015 | example_2 | 9
DF3
Timestamp | Word | Count
27/12/2015 | example_3 | 7
有没有办法用 PySpark (1.6) 做到这一点?
【问题讨论】:
标签: python apache-spark dataframe pyspark apache-spark-sql