【发布时间】:2020-06-07 06:29:43
【问题描述】:
我正在研究在我的组织中使用 Spark。 一种选择是将其用作独立集群。 似乎很清楚——除了我对此有很多疑问——在创建主服务器和一些从服务器时,Spark 将负责在集群成员上创建执行程序以操作数据。 我的问题与节点如何访问要处理的文件有关。由于没有 HDFS 可以处理,我是否需要授予对文件的每个节点的访问权限?例如 NFS 共享它或通过任何其他方式(复制到每个节点?)。 一旦节点可以访问文件,集群如何决定要处理文件的哪一部分,因为没有 HDFS 块来划分数据。 对此的任何启示将不胜感激。
胡安。
【问题讨论】:
标签: apache-spark