【发布时间】:2018-10-29 11:08:05
【问题描述】:
Hortonworks 数据平台 HDP 3.0 有 spark 2.3 和 Hive 3.1,默认情况下 spark 2.3 应用程序(pyspark/spark-sql 等)使用 spark 数据仓库,而 Spark 2.3 使用 Hive Warehouse Connector 与 Apache Hive 集成的方式不同。
integrating-apache-hive-with-apache-spark-hive-warehouse-connector
我可以在 Hive Metastore(MySQL) 中看到 2 个默认数据库。一个指向 Hive 位置,另一个指向 spark 位置。
mysql> SELECT NAME, DB_LOCATION_URI FROM hive.DBS;
+--------+----------------------------------------------------------+
| NAME | DB_LOCATION_URI |
+--------+----------------------------------------------------------+
| default| hdfs://<hostname>:8020/warehouse/tablespace/managed/hive |
| default| hdfs://<hostname>:8020/apps/spark/warehouse |
+--------+----------------------------------------------------------+
mysql>
谁能解释一下这两种仓库有什么区别,我找不到任何关于这个的文章,我们可以使用 spark 仓库而不是 Hive(我知道 spark 仓库不能通过 Hive 访问,或者有什么办法吗?)。这2个(spark仓库和hive仓库)的优缺点是什么?
【问题讨论】:
标签: apache-spark hive apache-spark-sql hortonworks-data-platform