【发布时间】:2021-05-13 07:49:22
【问题描述】:
我正在尝试使用 Spark 从 AWS S3 存储桶中读取 CSV 文件,目前通过 Jupyter 笔记本进行。
为 spark 设置 AWS S3 配置后,我在尝试读取 CSV 时收到此错误:
Py4JJavaError: An error occurred while calling SOMERANDOMNAME.csv.
: com.amazonaws.services.s3.model.AmazonS3Exception: Status Code: 400, AWS Service: Amazon S3, AWS Request ID: XXXXXXXXXX, AWS Error Code: null, AWS Error Message: Bad Request, S3 Extended Request ID: XXXXXXXXXXX
我设置配置的方式:
hadoopConf = spark.sparkContext._jsc.hadoopConfiguration()
hadoopConf.set("fs.s3a.endpoint", s3_endpoint_url)
hadoopConf.set("fs.s3a.access.key", s3_access_key_id)
hadoopConf.set("fs.s3a.secret.key", s3_secret_access_key)
hadoopConf.set("fs.s3a.path.style.access", "true")
我尝试读取 CSV 的方式:
data = spark.read.csv('s3a://' + s3_bucket + '/data.csv',sep=",", header=True)
运行该块会向我发送上述错误。你能帮我看看可能出了什么问题吗?
提前谢谢你!
【问题讨论】:
-
不是真的,我尝试了那里写的内容,但没有运气仍然得到错误。
Py4JJavaError: An error occurred while calling o894.csv. : org.apache.spark.SparkException: Job aborted due to stage failure: Task 0 in stage 15.0 failed 4 times, most recent failure: Lost task 0.3 in stage 15.0 (TID 73, 11.111.1.11, executor 0): com.amazonaws.services.s3.model.AmazonS3Exception: Status Code: 400, AWS Service: Amazon S3, AWS Request ID:, AWS Error Code: null, AWS Error Message: Bad Request, S3 Extended Request ID:
标签: amazon-web-services csv apache-spark amazon-s3