【发布时间】:2015-12-09 03:37:55
【问题描述】:
在 Spark 的常见问题解答中明确指出不必使用 HDFS:
我是否需要 Hadoop 来运行 Spark?
不可以,但如果您在集群上运行,您将需要某种形式的共享文件系统(例如,NFS 安装在每个节点的相同路径上)。如果你有这种类型的文件系统,你可以在独立模式下部署 Spark。
那么,如果我不打算使用 Hadoop MapReduce,那么与其他分布式文件系统(如 NFS)相比,将 Apache Spark 与 HDFS 结合使用有哪些优点/缺点?如果我使用 NFS 而不是 HDFS 作为节点存储(用于检查点、shuffle 溢出等),我会错过一个重要功能吗?
【问题讨论】:
-
我已经删除了我之前的回答。这个 SE 问题可能有助于比较 HDFS 与其他替代方案:stackoverflow.com/questions/32669187/…
标签: apache-spark nfs