【问题标题】:Local file and cluster mode本地文件和集群模式
【发布时间】:2016-05-31 11:40:01
【问题描述】:

我刚刚开始使用 Apache Spark。我正在使用集群模式,我想处理一个大文件。我正在使用 SparkContext 中的 textFile 方法,它将读取所有节点上可用的本地文件系统。 由于我的文件非常大,因此在每个集群节点中复制和粘贴是很痛苦的。我的问题是:有没有办法让这个文件在一个独特的位置,比如共享文件夹? 非常感谢

【问题讨论】:

    标签: apache-spark cluster-computing


    【解决方案1】:

    您可以将文件保存在 HadoopS3 中。 然后你可以在textFile方法本身中给出文件的路径。

    对于 s3:

    val data = sc.textFile("s3n://yourAccessKey:yourSecretKey@/path/")
    

    对于Hadoop:

    val hdfsRDD  = sc.textFile("hdfs://...")
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-11-25
      • 1970-01-01
      • 2020-10-22
      • 1970-01-01
      • 2014-11-19
      • 2019-05-08
      • 2017-07-04
      相关资源
      最近更新 更多