【发布时间】:2021-08-24 08:54:59
【问题描述】:
我正在尝试使用 df.write.csv 将 parquet 文件写入 CSV,但输出的 CSV 文件有一个大名称(部分 -0000-),我该如何重命名它?
我搜索了一下,发现可以使用下面的代码在scala中完成。
import org.apache.hadoop.fs._
fs = FileSystem.get(spark.hadoopConfiguration)
fs = FileSystem.get(sc.hadoopConfiguration)
fs.rename(new Path("csvDirectory/data.csv/part-0000"), new Path("csvDirectory/newData.csv"))
在pyspark中怎么做?
【问题讨论】:
-
检查this
-
用python可以吗?提前感谢
-
如果你的dataframe不是很大,转换df后使用
pandas.to_csv()toPandas,spark分部分写入数据是有原因的
标签: apache-spark pyspark