【发布时间】:2021-10-25 11:36:54
【问题描述】:
我正在使用 Apache Spark 3.1.0 和 Python 3.9.6。我正在尝试从 AWS S3 存储桶中读取 csv 文件,如下所示:
spark = SparkSession.builder.getOrCreate()
file = "s3://bucket/file.csv"
c = spark.read\
.csv(file)\
.count()
print(c)
但我收到以下错误:
py4j.protocol.Py4JJavaError: An error occurred while calling o26.csv.
: org.apache.hadoop.fs.UnsupportedFileSystemException: No FileSystem for scheme "s3"
我知道我需要添加特殊库,但我没有找到任何确切信息和版本。我试图在我的代码中添加这样的东西,但我仍然遇到同样的错误:
import os
os.environ['PYSPARK_SUBMIT_ARGS'] = '--packages com.amazonaws:aws-java-sdk:1.7.4,org.apache.hadoop:hadoop-aws:2.7.3 pyspark-shell'
我该如何解决这个问题?
【问题讨论】:
标签: amazon-web-services apache-spark amazon-s3 pyspark