【发布时间】:2018-12-21 00:19:01
【问题描述】:
我有一个 HDFS 集群(比如它有 5 个数据节点),如果我想设置一个 Spark 集群(比如它有 3 个工作节点)读/写数据到 HDFS 集群,我需要确保 Spark工作节点与 HDFS 数据节点在同一台机器上吗? IMO 他们可以是不同的机器。但是如果 Spark Worker 节点和 HDFS 数据节点是不同的机器,当从 HDFS 读取数据时,Spark Worker 节点需要从不同的机器下载数据,这会导致更高的延迟。如果它们在同一台机器上,则可以减少延迟。我的理解正确吗?
【问题讨论】:
-
是功德的答案吗?
标签: apache-spark hdfs