【发布时间】:2020-06-11 12:51:18
【问题描述】:
我很困惑应该使用哪种组合来实现我的目标,我需要将数据存储在 HDFS 中并需要根据查询的数据执行分析。
对此有一些疑问:
- 如果我将 hive 与 hadoop 一起使用,那么它将使用 map reduce,这会降低我的查询速度。(因为我使用 hadoop HDFS 在这里用于数据存储)
- 如果我使用 spark 引擎来评估我的查询,而不是 hadoop,它会更快,但 HDFS 呢?我将不得不创建另一个 hadoop 集群来将数据存储在 HDFS 中。
- 如果我们有 spark sql,那么 hive 需要什么?
- 如果我使用 spark sql 那么它将如何连接到 HDFS?
如果有人可以解释这些工具的用法。 谢谢!!
【问题讨论】:
标签: apache-spark hadoop hive apache-spark-sql hdfs