【发布时间】:2018-12-25 11:44:57
【问题描述】:
因此,在将 parquet 文件写入 s3 时,我可以使用以下代码更改目录名称:
spark_NCDS_df.coalesce(1).write.parquet(s3locationC1+"parquet")
现在,当我输出这个时,该目录中的内容如下:
我想做两处改变:
我可以更新
part-0000....snappy.parquet文件的文件名吗?我可以在没有
_SUCCESS、_committed和_started文件的情况下输出此文件吗?
我在网上找到的文档并不是很有帮助。
【问题讨论】:
-
Spark SQL 不支持名称自定义(您必须重命名结果),第二个问题看起来像 How to avoid generating crc files and SUCCESS files while saving a DataFrame? 的重复项
-
命令
sc.hadoopConfiguration.set("mapreduce.fileoutputcommitter.marksuccessfuljobs", "false")给我以下错误:AttributeError: 'RemoteContext' object has no attribute 'hadoopConfiguration' -
为什么不只是一个后处理步骤,使用
dbutils来清理和重命名?
标签: apache-spark amazon-s3 parquet databricks