【问题标题】:Spark stand alone cluster file accessSpark 独立集群文件访问
【发布时间】:2020-06-07 06:29:43
【问题描述】:

我正在研究在我的组织中使用 Spark。 一种选择是将其用作独立集群。 似乎很清楚——除了我对此有很多疑问——在创建主服务器和一些从服务器时,Spark 将负责在集群成员上创建执行程序以操作数据。 我的问题与节点如何访问要处理的文件有关。由于没有 HDFS 可以处理,我是否需要授予对文件的每个节点的访问权限?例如 NFS 共享它或通过任何其他方式(复制到每个节点?)。 一旦节点可以访问文件,集群如何决定要处理文件的哪一部分,因为没有 HDFS 块来划分数据。 对此的任何启示将不胜感激。

胡安。

【问题讨论】:

    标签: apache-spark


    【解决方案1】:

    由于没有 HDFS 可以处理,我是否需要授予对每个 节点到文件?

    没错。但是,不建议在 PoC 之外使用您命名的选项(NFS、本地 FS)。

    一旦节点可以访问文件,集群如何决定哪个 要处理的文件的一部分,因为没有 HDFS 块来划分 数据。

    这与文件格式有关(您想使用可拆分格式)。使用可拆分格式,不同的执行程序将能够并行读取和处理文件的不同部分。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-01-14
      • 1970-01-01
      • 2021-02-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-06-25
      • 1970-01-01
      相关资源
      最近更新 更多