【问题标题】:dataproc rename files written by spark in GCS folderdataproc 重命名 GCS 文件夹中 spark 写入的文件
【发布时间】:2019-07-15 19:27:53
【问题描述】:

我正在使用 Dataproc 来使用 Scala 实现 Spark 作业。我的 Spark 工作的目的是读取 GCS 中的数据进行一些转换,然后在 GCS 下写入结果数据。我们从 spark write 获得的文件是 PART-00 ,我想重命名它们,但我找不到任何解决方案,因为写入的文件在 gcs 而不是 hdfs 下。请知道如何解决这个问题。多谢。

【问题讨论】:

    标签: scala apache-spark google-cloud-dataproc


    【解决方案1】:

    在 Dataproc 集群上,您仍然可以像对 HDFS 一样对 GCS 运行相同的 hadoop fs -mv 命令,但使用完整的“gs://bucket/filename...”路径。

    【讨论】:

    • 此外,在 Spark(或 PySpark)中,您可以使用 gs:// prefix
    猜你喜欢
    • 2017-11-29
    • 2019-01-26
    • 2020-03-04
    • 1970-01-01
    • 2019-06-22
    • 2014-09-09
    • 2012-09-03
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多