【发布时间】:2019-08-01 14:57:55
【问题描述】:
我尝试使用 PySpark 访问 Hive ORC 事务表(在 HDFS 上有基础增量文件),但我无法通过 sparkContext/hiveContext 读取事务表。
/mydim/delta_0117202_0117202
/mydim/delta_0117203_0117203
【问题讨论】:
标签: apache-spark hadoop hive pyspark pyspark-sql
我尝试使用 PySpark 访问 Hive ORC 事务表(在 HDFS 上有基础增量文件),但我无法通过 sparkContext/hiveContext 读取事务表。
/mydim/delta_0117202_0117202
/mydim/delta_0117203_0117203
【问题讨论】:
标签: apache-spark hadoop hive pyspark pyspark-sql
Hive-ACID 表尚未正式支持
Spark,请获取full dump/incremental dump of acid table到常规的hive orc/parquet分区表,然后使用 spark 读取数据。
有一个 Open Jira saprk-15348 以添加对读取 Hive ACID 表的支持。
如果您在 Acid 表(来自 hive)上运行 major compaction,则 spark 只能读取 base_XXX 目录,但不能读取增量目录 Spark-16996在这个 jira 中解决。
有一些解决方法可以使用此链接中提到的SPARK-LLAP 读取酸表。
我认为从HDP-3.X开始HiveWareHouseConnector能够支持读取HiveAcid表。
【讨论】: