【发布时间】:2020-07-09 04:29:03
【问题描述】:
我已将 Spark 数据帧写入分区的 ORC 文件,如下所示:
df.repartition("LOADED")\
.write\
.partitionBy("LOADED")\
.format("orc")\
.save("location")
一切都在磁盘上正确。 之后,我想从中创建一个 Hive 表,例如:
CREATE TABLE table USING ORC LOCATION 'location'
命令运行没有任何错误。但是如果我尝试查询该表,它是空的。
我尝试在不分区的情况下做同样的事情,它工作得很好。我究竟做错了什么?
分区文件夹如下所示:LOADED=2019-11-16
供参考:我想将数据写入 Azure Blob 存储,并在不同的集群中从中创建 Hive 表。
【问题讨论】:
标签: apache-spark pyspark hive partitioning orc