【问题标题】:write new data into the existing parquet file with append write mode使用追加写入模式将新数据写入现有 parquet 文件
【发布时间】:2020-08-13 15:12:41
【问题描述】:

我正在使用下面的代码 sn-p 来保存数据。它只会在同一个分区文件夹下创建一个新的 parquet 文件。有没有办法真正将数据附加到现有的镶木地板文件中。所以如果一天有很多追加,我们最终不会有多个文件吗?

df.coalesce(1).write.mode('append').partitionBy("paritionKey").parquet('...\parquet_file_folder\')

非常感谢您的帮助。

【问题讨论】:

    标签: pyspark


    【解决方案1】:

    从这里查看答案:How can I append to same file in HDFS(spark 2.11)

    “在 Spark 中追加意味着写入现有目录而不是追加到文件。

    这是有意和期望的行为(想想如果进程在“追加”过程中失败会发生什么,即使格式和文件系统允许这样做)。

    如有必要,合并文件等操作应由单独的进程应用,以确保正确性和容错性。不幸的是,这需要一个完整的副本,出于显而易见的原因,这并不需要逐批进行。”

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-07-03
      • 2021-03-12
      • 2022-01-04
      • 2018-11-21
      • 1970-01-01
      • 2011-06-14
      • 1970-01-01
      • 2011-12-24
      相关资源
      最近更新 更多