【发布时间】:2017-09-25 16:32:47
【问题描述】:
关于如何使用 scala 阅读 aws s3 的任何想法。我试过这个链接
https://www.cloudera.com/documentation/enterprise/5-5-x/topics/spark_s3.html
但无法让它工作。我可以在数据块中这样做,但使用 dsx 时它不起作用等等。
IBM 在此处记录了 python 的步骤,但没有记录 scala 的步骤 - https://datascience.ibm.com/blog/use-ibm-data-science-experience-to-read-and-write-data-stored-on-amazon-s3/
spark.sparkContext.hadoopConfiguration.set("fs.s3n.impl","org.apache.hadoop.fs.s3native.NativeS3FileSystem") spark.sparkContext.hadoopConfiguration.set("fs.s3n.awsAccessKeyId", "xyz") spark.sparkContext.hadoopConfiguration.set("fs.s3n.awsSecretAccessKey", "abc")
val df_data_1 = spark.read.format("csv").option("header", "true").load("s3a://defg/retail-data/by-day/*.csv") df_data_1.take(5)
【问题讨论】:
-
你想用 spark 从 s3 读取数据吗?如果是这样,请更新您的标题和标签。还发布您编写的不起作用的代码
标签: scala data-science-experience