【问题标题】:Do I need to use Spark with YARN to achieve NODE LOCAL data locality with HDFS?我是否需要使用 Spark 和 YARN 来通过 HDFS 实现 NODE LOCAL 数据本地化?
【发布时间】:2017-02-27 08:00:56
【问题描述】:

我是否需要将 Spark 与 YARN 结合使用才能通过 HDFS 实现 NODE LOCAL 数据本地化?
如果我使用 Spark 独立集群管理器并将我的数据分布在 HDFS 集群中,Spark 如何知道数据位于本地节点上?

【问题讨论】:

    标签: hadoop apache-spark hdfs


    【解决方案1】:

    YARN 是一个资源管理器。它处理内存和进程,而不是 HDFS 或数据局部性的工作。

    由于 Spark 可以从 HDFS 源读取数据,并且 namenodes 和 datanodes 负责 YARN 之外的所有 HDFS 块数据管理,所以我相信答案是否定的,您不需要 YARN。但是您已经拥有 HDFS,这意味着您拥有 Hadoop,那么为什么不利用将 Spark 集成到 YARN 中呢?

    【讨论】:

    • 我的意思是,我可能是错的,但我知道非 YARN Spark 仍然可以读写 HDFS。 “使用 HDFS,Spark 驱动程序会联系 NameNode,了解包含文件或目录的各种块及其位置的 DataNode(理想情况下是本地的)” 在 YARN 上运行 Spark 可能会允许其他参数跨度>
    猜你喜欢
    • 1970-01-01
    • 2020-11-06
    • 1970-01-01
    • 2019-04-01
    • 2015-12-16
    • 2017-05-08
    • 1970-01-01
    • 2018-11-04
    • 2023-01-24
    相关资源
    最近更新 更多