【问题标题】:How to resolve spark error when reading from s3从s3读取时如何解决火花错误
【发布时间】:2021-11-12 11:30:10
【问题描述】:

运行 spark 应用程序时出现错误(java.io.IOException: No FileSystem for scheme: S3a)。我已经查看了有关此类错误的各种其他问题,但我无法确定解决方案。 Spark 是 3.1.2 版

更新了以下详细信息以反映当前状态

pyspark 脚本:


import os
#os.environ['PYSPARK_SUBMIT_ARGS'] = '--packages com.amazonaws:aws-java-sdk:1.7.4,org.apache.hadoop:hadoop-aws:2.7.4 pyspark-shell'
from pyspark.sql import SparkSession


spark = SparkSession.builder \
            .appName("s3reader") \
            .getOrCreate()\

sc = spark.sparkContext

#sc._jsc.hadoopConfiguration().set("fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem")
#sc._jsc.hadoopConfiguration().set("fs.s3a.access.key", "xxxxxxx")
#sc._jsc.hadoopConfiguration().set("fs.s3a.secret.key", "xxxxxxxxxxxx")
#sc._jsc.hadoopConfiguration().set("fs.s3a.endpoint","xxx.x.xxx.x.com", "us-1-east")
#sc._jsc.hadoopConfiguration().set("fs.s3a.path.style.access", "true")

df = spark.read.json("S3a://silver/testfolder/4a2426b2-856c-4e9b-b698-b3dcdca74f48")

print(df)


这是我的 jar 版本:

cloud@spark-dev-master:/usr/local/spark/jars$ ls -ltr *aws*

-rw-rw-r-- 1 cloud cloud 126287 Aug 18  2016 hadoop-aws-2.7.4.jar

-rw-rw-r-- 1 cloud cloud   4479 Sep 17 02:36 aws-java-sdk-1.7.4.jar

堆栈跟踪:

Traceback (most recent call last):
  File "/home/cloud/sparks3test.py", line 18, in <module>
    df = spark.read.json("S3a://silver/testfolder/4a2426b2-856c-4e9b-b698-b3dcdca74f48")
  File "/usr/local/spark/python/lib/pyspark.zip/pyspark/sql/readwriter.py", line 372, in json
  File "/usr/local/spark/python/lib/py4j-0.10.9-src.zip/py4j/java_gateway.py", line 1304, in __call__
  File "/usr/local/spark/python/lib/pyspark.zip/pyspark/sql/utils.py", line 111, in deco
  File "/usr/local/spark/python/lib/py4j-0.10.9-src.zip/py4j/protocol.py", line 326, in get_return_value
py4j.protocol.Py4JJavaError: An error occurred while calling o33.json.
: java.io.IOException: No FileSystem for scheme: S3a
        at org.apache.hadoop.fs.FileSystem.getFileSystemClass(FileSystem.java:2660)
        at org.apache.hadoop.fs.FileSystem.createFileSystem(FileSystem.java:2667)
        at org.apache.hadoop.fs.FileSystem.access$200(FileSystem.java:94)
        at org.apache.hadoop.fs.FileSystem$Cache.getInternal(FileSystem.java:2703)
        at org.apache.hadoop.fs.FileSystem$Cache.get(FileSystem.java:2685)
        at org.apache.hadoop.fs.FileSystem.get(FileSystem.java:373)
        at org.apache.hadoop.fs.Path.getFileSystem(Path.java:295)
        at org.apache.spark.sql.execution.streaming.FileStreamSink$.hasMetadata(FileStreamSink.scala:46)
        at org.apache.spark.sql.execution.datasources.DataSource.resolveRelation(DataSource.scala:377)
        at org.apache.spark.sql.DataFrameReader.loadV1Source(DataFrameReader.scala:325)
        at org.apache.spark.sql.DataFrameReader.$anonfun$load$3(DataFrameReader.scala:307)
        at scala.Option.getOrElse(Option.scala:189)
        at org.apache.spark.sql.DataFrameReader.load(DataFrameReader.scala:307)
        at org.apache.spark.sql.DataFrameReader.json(DataFrameReader.scala:519)
        at java.base/jdk.internal.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
        at java.base/jdk.internal.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:62)
        at java.base/jdk.internal.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
        at java.base/java.lang.reflect.Method.invoke(Method.java:566)
        at py4j.reflection.MethodInvoker.invoke(MethodInvoker.java:244)
        at py4j.reflection.ReflectionEngine.invoke(ReflectionEngine.java:357)
        at py4j.Gateway.invoke(Gateway.java:282)
        at py4j.commands.AbstractCommand.invokeMethod(AbstractCommand.java:132)
        at py4j.commands.CallCommand.execute(CallCommand.java:79)
        at py4j.GatewayConnection.run(GatewayConnection.java:238)
        at java.base/java.lang.Thread.run(Thread.java:829)

【问题讨论】:

  • 我还尝试按照其他帖子中的建议将 aws-java-sdk 版本更改为 1.7.4,并更新了 spark-default.conf 文件以匹配。同样的错误仍然存​​在...

标签: apache-spark amazon-s3 pyspark


【解决方案1】:

您需要使用 hadoop-aws 3.2.0 版。

你可以参考我之前的回答here

【讨论】:

  • 感谢您的意见,但这并没有帮助。我将 hadoop-aws jar 更新为 3.2.0,将其设置在 spark-default.conf 文件中,并将 os.environment 行添加到我的代码中,但同样的错误仍然存​​在。
  • 你使用过 --packages 吗?删除之前在 jars 文件夹中添加的 jar,并通过指定 hadoop-aws3.20 来使用 --packages。它将下载所有必需的依赖项。
  • 只需使用fs.s3a.access.keyfs.s3a.access.key 并在读取文件时使用s3a:// 而不是s3://
  • 我删除了所有以前的 jar 文件,使用 s3a 而不是 s3://,但错误仍然存​​在。我将更新我上面的代码以反映当前状态。
【解决方案2】:

我收到一个错误(java.lang.NoClassDefFoundError:org/apache/hadoop/fs/StreamCapabilities)

这是混合使用 hadoop-aws 和 hadoop-common JAR 版本时看到的内容。它们必须逐点匹配(火花 JAR 也需要)。

不要尝试解决这个问题,除非通过同步 JAR,您只会移动堆栈跟踪。

见 Hadoop troubleshooting s3a

【讨论】:

  • 谢谢@stevel。我已确保 hadoop-aws 和 hadoop-common 的 jar 版本与 Maven 存储库中指定的版本相同(2.7.4)。我还将驱动程序和执行程序的类路径信息添加到 spark-defaults.conf 中......但我得到 No FileSystem for scheme: S3a
  • 好吧,恐怕是类路径/版本设置问题。
  • 你的意思是hadoop-common和hadoop-aws之间还有版本冲突吗?
  • 不可避免。我在这里使用我的 cloudstore 诊断工具来调试 hadoop 安装,但它不能直接使用 spark。值得我考虑将来如何做到这一点:github.com/steveloughran/cloudstore
【解决方案3】:

由于似乎仍然存在 jar 依赖问题,我使用 3.1.2 和 hadoop 3.2.0 在 spark 上进行了全新安装,并将 hadoop-aws 和 java-sdk jar 与 master 和 worker 上的 aws-common jar 版本对齐节点。这更正了文件系统问题。因此,升级到 3.2.0 还纠正了我们运行到的端点问题以及 path.style.access=true 在任何早于 2.8.0 的 hadoop 版本中不受支持。此处记录了该问题:https://issues.apache.org/jira/browse/HADOOP-12963 供参考。

【讨论】:

    猜你喜欢
    • 2018-06-19
    • 2020-05-06
    • 1970-01-01
    • 2018-12-20
    • 2020-04-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-02-17
    相关资源
    最近更新 更多