【发布时间】:2020-08-13 15:12:41
【问题描述】:
我正在使用下面的代码 sn-p 来保存数据。它只会在同一个分区文件夹下创建一个新的 parquet 文件。有没有办法真正将数据附加到现有的镶木地板文件中。所以如果一天有很多追加,我们最终不会有多个文件吗?
df.coalesce(1).write.mode('append').partitionBy("paritionKey").parquet('...\parquet_file_folder\')
非常感谢您的帮助。
【问题讨论】:
标签: pyspark