【发布时间】:2018-02-28 10:37:57
【问题描述】:
我的数据如下图
Store ID Amount,...
1 1 10
1 2 20
2 1 10
3 4 50
我必须为每个商店创建单独的目录
Store 1/accounts
ID Amount
1 10
2 20
store 2/accounts directory:
ID Amount
1 10
为此,我可以在 Spark 数据帧中使用循环吗?它在本地机器上工作。会不会是集群的问题
while storecount<=50:
query ="SELECT * FROM Sales where Store={}".format(storecount)
DF =spark.sql(query)
DF.write.format("csv").save(path)
count = count +1
【问题讨论】:
-
您可以根据自己的需要调整此解决方案:stackoverflow.com/questions/30338213/…
标签: apache-spark spark-dataframe pyspark-sql