【发布时间】:2022-11-12 06:40:30
【问题描述】:
我正在使用 pyspark 从谷歌云存储桶中读取镶木地板文件。一切正常,直到我尝试从不同的存储桶中获取数据 - 3 个文件。 阅读第三个文件时,我得到:
原因:com.amazonaws.services.s3.model.AmazonS3Exception: Forbidden (Service: Amazon S3; Status Code: 403; Error Code: 403 Forbidden; Request ID: null; S3 Extended Request ID: null), S3 Extended Request ID : 无效的
如果我改变我正在阅读的文件的顺序(例如第三个是第一个),一切都很好。
我的火花设置:
spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.access.key", configuration.user) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.secret.key", configuration.password) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.endpoint", configuration.endpoint) spark_session.sparkContext._jsc.hadoopConfiguration().set( "fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem" ) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.path.style.access", "true")我在用: hadoop-aws-3.2.0.jar aws-java-sdk-bundle-1.11.704.jar spark-hadoop-cloud_2.13-3.2.0.jar
【问题讨论】:
标签: apache-spark amazon-s3 google-cloud-platform pyspark google-cloud-storage