【问题标题】:Using Apache Spark with HDFS vs. other distributed storage将 Apache Spark 与 HDFS 结合使用与其他分布式存储
【发布时间】:2015-12-09 03:37:55
【问题描述】:

在 Spark 的常见问题解答中明确指出不必使用 HDFS:

我是否需要 Hadoop 来运行 Spark?

不可以,但如果您在集群上运行,您将需要某种形式的共享文件系统(例如,NFS 安装在每个节点的相同路径上)。如果你有这种类型的文件系统,你可以在独立模式下部署 Spark。

那么,如果我不打算使用 Hadoop MapReduce,那么与其他分布式文件系统(如 NFS)相比,将 Apache Spark 与 HDFS 结合使用有哪些优点/缺点?如果我使用 NFS 而不是 HDFS 作为节点存储(用于检查点、shuffle 溢出等),我会错过一个重要功能吗?

【问题讨论】:

标签: apache-spark nfs


【解决方案1】:

经过几个月的 NFS 和 HDFS 经验,我现在可以回答我自己的问题了:

NFS 允许查看/更改远程机器上的文件,就好像它们存储在本地机器上一样。 HDFS 也可以做到这一点,但它是分布式的(与 NFS 相对)并且具有容错性和可扩展性。

使用 NFS 的优点是设置简单,因此我可能会将它用于 QA 环境或小型集群。 HDFS 的优势当然是它的容错性,但更大的优势,恕我直言,当 HDFS 与 Spark 节点位于同一位置时,它能够利用局部性,从而为检查点、shuffle 溢出等提供最佳性能。

【讨论】:

  • 你会不会碰巧有一些文档显示 NFS 与 HDFS 的性能或分布式优势与独立。我知道 Cassandra 分布式系统的容错性,但是如果您将 Spark 系统传播到周围,它对生态系统有何帮助。
猜你喜欢
  • 2015-08-22
  • 1970-01-01
  • 1970-01-01
  • 2014-03-17
  • 2014-04-16
  • 1970-01-01
  • 2019-03-03
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多