【发布时间】:2020-11-23 22:48:46
【问题描述】:
我需要按列中的值在单独的 s3 键中编写镶木地板文件。 city 列有数千个值。使用 for 循环进行迭代,按每列值过滤数据帧,然后编写 parquet 非常慢。有没有办法按city 列对数据框进行分区并写入拼花文件?
我现在在做什么 -
for city in cities:
print(city)
spark_df.filter(spark_df.city == city).write.mode('overwrite').parquet(f'reporting/date={date_string}/city={city}')
【问题讨论】:
标签: dataframe apache-spark pyspark