【发布时间】:2018-09-19 01:50:38
【问题描述】:
我正在以编程方式创建瞬态 EMR Spark 集群,读取 vanilla S3 对象,将其转换为 Dataframe 并写入 parquet 文件。
在本地集群上运行(提供 S3 凭据)一切正常。
启动临时集群并提交作业在写入 S3 时失败,并出现以下错误:
AmazonS3Exception: The AWS Access Key Id you provided does not exist in our records.
但我的工作能够从 S3 读取 vanilla 对象,并正确记录到 S3。此外,我看到EMR_EC2_DefaultRole 设置为EC2 instance profile,并且EMR_EC2_DefaultRole 具有适当的S3 权限,并且我的存储桶具有为EMR_EC2_DefaultRole 设置的策略。
我得到我试图将 parquet 文件写入的“文件系统”是特殊的,但我不知道需要设置什么才能使其工作。
【问题讨论】:
标签: amazon-web-services apache-spark amazon-s3 amazon-emr