【问题标题】:How can I execute a S3-dist-cp command within a spark-submit application如何在 spark-submit 应用程序中执行 S3-dist-cp 命令
【发布时间】:2018-12-21 02:20:04
【问题描述】:

我有一个 jar 文件,它在 jar 的方法中提供给 spark-submit.With。我正在尝试做一个

Import sys.process._
s3-dist-cp —src hdfs:///tasks/ —dest s3://<destination-bucket>

我还与 master 一起在所有药膏上安装了 s3-dist-cp。 应用程序启动并成功,但没有将数据移动到 S3。

【问题讨论】:

    标签: scala apache-spark bigdata spark-submit s3distcp


    【解决方案1】:

    这不是您问题的正确直接答案,但我使用了 hadoop distcp (https://hadoop.apache.org/docs/current/hadoop-distcp/DistCp.html) 并成功移动了数据。在我的测试中,它与 spark.write.parquet(path) 相比相当慢(当考虑到使用 hadoop distcp 所需的额外写入 hdfs 所花费的时间时)。不过,我也对您的问题的答案非常感兴趣;考虑到 Amazon 进行的额外优化,我认为 s3-dist-cp 可能会更快。

    【讨论】:

    • 请将此添加为评论而不是答案。你已经说这不是一个直接的答案!
    • 我的帐户目前没有足够的代表发表评论,如果您或其他任何人认为删除此答案会更有帮助,请告诉我。
    【解决方案2】:

    s3-dist-cp 现在是 EMR 集群主节点上的默认设置。

    如果 spark 应用程序以“客户端”模式提交,我可以在 spark-submit 中成功执行 s3-dist-cp。

    【讨论】:

    • 能否请您评论执行 s3-dist-cp 并将文件从 hdfs 移动到 s3 的 spark-submit 脚本
    猜你喜欢
    • 1970-01-01
    • 2020-07-23
    • 1970-01-01
    • 2018-09-16
    • 2019-08-28
    • 1970-01-01
    • 1970-01-01
    • 2017-10-14
    • 1970-01-01
    相关资源
    最近更新 更多