【发布时间】:2021-11-01 13:36:23
【问题描述】:
在尝试将 pyspark DataFrame 保存到 csv 并尝试直接存储 s3 存储桶时, 文件正在保存,但它有垃圾数据。所有文件大小均为 1B。 请帮助我在哪里做错了。
python 代码
df.write.options("header","true").csv("s3a://example/csv")
也试试这个代码
df.coalesce(1).write.format("csv").option("header", "true").option("path", "s3://example/test.csv").save()
但在 s3 存储桶中没有得到正确的 csv
【问题讨论】:
-
您能详细说明一下数据吗?我无法理解垃圾数据部分。
-
请注意,spark 将创建一个名为
test.csv的文件夹,其中将是 csv 部分文件或在coalesce()的情况下整理的文件。文件名会使它看起来像是垃圾数据。但是,这只是 spark 使用的命名约定。文件中的内容将根据您的数据框。 -
源系统和目标系统的编码是否相同?检查spark csv encoding