【问题标题】:Hive with Hadoop vs Hive with spark vs spark sql vs HDFS - How do they all work with each other?Hive with Hadoop vs Hive with spark vs spark sql vs HDFS - 它们如何相互协作?
【发布时间】:2020-06-11 12:51:18
【问题描述】:

我很困惑应该使用哪种组合来实现我的目标,我需要将数据存储在 HDFS 中并需要根据查询的数据执行分析。

对此有一些疑问:

  1. 如果我将 hive 与 hadoop 一起使用,那么它将使用 map reduce,这会降低我的查询速度。(因为我使用 hadoop HDFS 在这里用于数据存储)
  2. 如果我使用 spark 引擎来评估我的查询,而不是 hadoop,它会更快,但 HDFS 呢?我将不得不创建另一个 hadoop 集群来将数据存储在 HDFS 中。
  3. 如果我们有 spark sql,那么 hive 需要什么?
  4. 如果我使用 spark sql 那么它将如何连接到 HDFS?

如果有人可以解释这些工具的用法。 谢谢!!

【问题讨论】:

    标签: apache-spark hadoop hive apache-spark-sql hdfs


    【解决方案1】:
    1. 您可以在 Spark 上使用 Hive。 https://cwiki.apache.org/confluence/display/Hive/Hive+on+Spark
    2. 您不需要创建另一个 Hadoop 集群。 Spark 可以从 HDFS 访问数据。
    3. Spark 可以与 Hive 一起使用,也可以不与 Hive 一起使用。
    4. Spark 可以连接到多个数据源,包括 HDFS。

    【讨论】:

      猜你喜欢
      • 2018-07-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-10-15
      • 1970-01-01
      • 2023-03-23
      • 2016-06-04
      相关资源
      最近更新 更多