【问题标题】:AWS EMR Apache Spark and custom S3 endpoint in VPCVPC 中的 AWS EMR Apache Spark 和自定义 S3 终端节点
【发布时间】:2019-04-03 21:51:22
【问题描述】:

我在 VPС 中使用 Apache Spark 和 Redshift,并且还使用 AWS S3 作为 Redshift COPY 的源数据和临时数据。

现在我怀疑从/向 AWS S3 读取/写入的性能不够好,根据以下讨论中的建议 https://github.com/databricks/spark-redshift/issues/318 我已经在 VPC 中创建了 S3 端点。现在,当我从 S3 加载数据时,我在创建 S3 端点之前和之后看不到任何性能差异。

在 Apache Spark 中,我通过以下方式读取数据:

spark.read.csv("s3://example-dev-data/dictionary/file.csv")

我是否需要在 AWS EMR Apache Spark 上添加/配置一些额外的逻辑/配置才能正确使用 AWS S3 端点?

【问题讨论】:

    标签: amazon-web-services apache-spark amazon-s3 amazon-emr


    【解决方案1】:

    S3 VPC 终端节点是 Gateway Endpoint,因此您必须在子网的路由表中添加一个新条目,并在其中启动将流量路由到终端节点的 EMR 集群。

    【讨论】:

      猜你喜欢
      • 2022-01-09
      • 2017-07-27
      • 2018-02-07
      • 2021-11-25
      • 1970-01-01
      • 2020-03-03
      • 2021-05-15
      • 2019-05-01
      • 2020-06-05
      相关资源
      最近更新 更多