【发布时间】:2019-02-10 11:07:51
【问题描述】:
我正在使用 Spark 2.3 版使用 bucketBy 写入和保存数据帧。
表是在 Hive 中创建的,但架构不正确。我无法从 Hive 表中选择任何数据。
(DF.write
.format('orc')
.bucketBy(20, 'col1')
.sortBy("col2")
.mode("overwrite")
.saveAsTable('EMP.bucketed_table1'))
我收到以下消息:
以与 Hive 不兼容的 Spark SQL 特定格式将分桶数据源表
emp.bucketed_table1持久化到 Hive 元存储中。
Hive Schema 正在创建中,如下所示:
hive> desc EMP.bucketed_table1;
OK
col array<string> from deserializer
如何将数据帧保存并写入 Hive 表以供日后查看?
【问题讨论】:
-
尝试在 Hive 中创建分桶表,然后从 Spark 而不是
saveAsTable插入其中
标签: apache-spark pyspark hive