【发布时间】:2016-05-31 11:40:01
【问题描述】:
我刚刚开始使用 Apache Spark。我正在使用集群模式,我想处理一个大文件。我正在使用 SparkContext 中的 textFile 方法,它将读取所有节点上可用的本地文件系统。 由于我的文件非常大,因此在每个集群节点中复制和粘贴是很痛苦的。我的问题是:有没有办法让这个文件在一个独特的位置,比如共享文件夹? 非常感谢
【问题讨论】:
标签: apache-spark cluster-computing
我刚刚开始使用 Apache Spark。我正在使用集群模式,我想处理一个大文件。我正在使用 SparkContext 中的 textFile 方法,它将读取所有节点上可用的本地文件系统。 由于我的文件非常大,因此在每个集群节点中复制和粘贴是很痛苦的。我的问题是:有没有办法让这个文件在一个独特的位置,比如共享文件夹? 非常感谢
【问题讨论】:
标签: apache-spark cluster-computing
您可以将文件保存在 Hadoop 或 S3 中。
然后你可以在textFile方法本身中给出文件的路径。
对于 s3:
val data = sc.textFile("s3n://yourAccessKey:yourSecretKey@/path/")
对于Hadoop:
val hdfsRDD = sc.textFile("hdfs://...")
【讨论】: