【发布时间】:2017-02-27 08:00:56
【问题描述】:
我是否需要将 Spark 与 YARN 结合使用才能通过 HDFS 实现 NODE LOCAL 数据本地化?
如果我使用 Spark 独立集群管理器并将我的数据分布在 HDFS 集群中,Spark 如何知道数据位于本地节点上?
【问题讨论】:
标签: hadoop apache-spark hdfs
我是否需要将 Spark 与 YARN 结合使用才能通过 HDFS 实现 NODE LOCAL 数据本地化?
如果我使用 Spark 独立集群管理器并将我的数据分布在 HDFS 集群中,Spark 如何知道数据位于本地节点上?
【问题讨论】:
标签: hadoop apache-spark hdfs
YARN 是一个资源管理器。它处理内存和进程,而不是 HDFS 或数据局部性的工作。
由于 Spark 可以从 HDFS 源读取数据,并且 namenodes 和 datanodes 负责 YARN 之外的所有 HDFS 块数据管理,所以我相信答案是否定的,您不需要 YARN。但是您已经拥有 HDFS,这意味着您拥有 Hadoop,那么为什么不利用将 Spark 集成到 YARN 中呢?
【讨论】: