【发布时间】:2015-08-05 10:26:11
【问题描述】:
我在 AWS EC2 VM (Ubuntu 14.04) 上,愿意在我的 S3 文件中的 RDD 上使用 Spark 做一些基础知识。在成功运行这个脏命令时(暂时不使用sparkContext.hadoopConfiguration)
scala> val distFile = sc.textFile("s3n://< AWS_ACCESS_KEY_ID>:<AWS_SECRET_ACCESS_KEY>@bucketname/folder1/folder2/file.csv")
然后在运行distFile.count() 时出现以下错误
java.lang.NoClassDefFoundError: org/jets3t/service/ServiceException
at org.apache.hadoop.fs.s3native.NativeS3FileSystem.createDefaultStore(NativeS3FileSystem.java:334)
at org.apache.hadoop.fs.s3native.NativeS3FileSystem.initialize(NativeS3FileSystem.java:324)
at org.apache.hadoop.fs.FileSystem.createFileSystem(FileSystem.java:2596)
...
...
Caused by: java.lang.ClassNotFoundException: org.jets3t.service.ServiceException
at java.net.URLClassLoader$1.run(URLClassLoader.java:366)
at java.net.URLClassLoader$1.run(URLClassLoader.java:355)
以前有过
- 使用相应的 AWS_ACCESS_KEY_ID 和 AWS_SECRET_ACCESS_KEY 定义了一个 AWS IAM 用户
- 在 .bashrc 中添加了两个键的
export作为环境变量 - 使用
SPARK_HADOOP_VERSION=2.6.0-cdh5.4.1 sbt/sbt assembly构建了 Spark 1.3.1 - 安装并运行 hadoop 2.6-cdh5.4.1(伪分布式)
它是否与 textFile("s3n// ...") 的语法有关?我尝试过其他人,包括 s3:// 没有成功...
谢谢
【问题讨论】:
标签: amazon-ec2 amazon-s3 apache-spark hadoop2