【问题标题】:Set S3 object metadata (tag) when writing RDD to S3 with Spark使用 Spark 将 RDD 写入 S3 时设置 S3 对象元数据(标签)
【发布时间】:2021-06-06 10:43:30
【问题描述】:

从 Spark 将 RDD 写入 S3 时,有没有办法设置 S3 对象的元数据(我想设置标签)?我发现的示例(例如 Amazon'sSpark set S3 object metadata while writing to EMRFS)是针对 DataFrame,而不是 RDD。

【问题讨论】:

    标签: apache-spark amazon-s3 metadata rdd


    【解决方案1】:

    截至 2021 年 3 月 9 日,不在 s3a 代码库中。不知道 EMR 的 s3 连接器

    【讨论】:

    • 谢谢。亚马逊证实了这一点。
    • 好吧,s3a 项目将进行 PR,并进行测试。没有理由阻止任何人这样做。 Hadoop .3.3.1 将允许您通过现有的 XAttr API (ee getXAttr("header.etag"); 查询任何标头;但是 setXAttr 调用没有用,因为它只能在文件写入后调用。我们需要添加 createFile() 选项,并将 Spark 移至使用该 API 编写文件 - 或至少是 parquet 库
    • 使用,但我使用的是 EMR,它使用的是 Amazon 的 s3 连接器。
    • 担心您可能不得不求助于 AWS S3 API 并自己在新创建的文件上添加标签。
    • “令人讨厌的是,没有办法让 S3 只记录写入。”。等到您尝试跨集群调试竞争条件。您会欣赏完整的日志。请记住寻找分段上传以及简单的 PUT 请求...重命名和大文件是分段的
    猜你喜欢
    • 1970-01-01
    • 2017-12-28
    • 2021-11-15
    • 1970-01-01
    • 2018-03-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多