【问题标题】:Hadoop's HDFS with SparkHadoop 的 HDFS 与 Spark
【发布时间】:2015-03-31 20:29:53
【问题描述】:

我是集群计算的新手,我正在尝试在 Spark 中设置一个最小的 2 节点集群。 我仍然有点困惑:我是否必须首先设置完整的 Hadoop 安装,或者 Spark 是否附带包含 Hadoop 版本?

我发现的关于 Spark 的资料并没有真正说明这一点。我知道 Spark 是作为 Hadoop 的扩展而不是替代它,但我不清楚它是否需要独立运行的 Hadoop 系统。

我需要一个 HDFS,因此仅使用 Hadoop 的文件系统部分就足够了吗?

有人可以向我指出这个可能很明显的事情吗?

【问题讨论】:

    标签: hadoop apache-spark


    【解决方案1】:

    Apache Spark 独立于 Hadoop。 Spark 允许您使用不同的数据源(包括 HDFS),并且能够在独立集群中运行,或者使用现有的资源管理框架(例如 YARN、Mesos)。

    所以如果您只对 Spark 感兴趣,则无需安装 Hadoop。

    【讨论】:

    • 但是,如果您计划使用 Hadoop,则必须针对 Hadoop 二进制文件编译 Spark。查看更多信息:etushar89.wordpress.com/2014/12/28/…
    • 谢谢。如果我想使用 HDFS,我将不得不安装整个 Hadoop 包,尽管如果我只关心 HDFS,我可能不必完成整个 Hadoop 配置步骤,对吧?
    • 你也应该关心资源管理器,以防你要使用它(YARN)。如果你打算在独立模式下运行 Spark,我知道你不需要它。
    • 如果你想避免建立自己的集群,你可以使用 Amazon S3 代替 HDFS 并避免所有的配置工作。
    • 如果要使用HDFS,需要对Hadoop进行全面配置。 Hadoop 是启用 HDFS 的“操作系统”,没有 Hadoop,您将无法访问 HDFS。
    猜你喜欢
    • 1970-01-01
    • 2018-05-29
    • 1970-01-01
    • 2016-12-20
    • 2020-09-26
    • 1970-01-01
    • 1970-01-01
    • 2016-04-18
    • 1970-01-01
    相关资源
    最近更新 更多