【发布时间】:2016-10-24 15:39:11
【问题描述】:
我正在运行一个 Spark 作业,就逻辑而言,它的性能非常好。但是,当我使用 saveAsTextFile 将文件保存在 s3 存储桶中时,我的输出文件的名称格式为 part-00000、part-00001 等。有没有办法改变输出文件名?
谢谢。
【问题讨论】:
-
最好使用 shell 而不是在 Spark 中执行此操作。例如,您可以使用
coalesce将所有内容收集到一个文件中,但它会给内存带来压力——此外,hdfs 的工作方式与常规文件系统略有不同,Spark 总是为每个输出创建不同的目标/文件夹。
标签: hadoop apache-spark spark-streaming spark-dataframe