【发布时间】:2019-01-13 17:31:27
【问题描述】:
我有存储为 Parquet 的外部配置单元表,分区在一个列上,例如 as_of_dt,并且数据通过火花流插入。
现在每天都会添加新分区。我正在做msck repair table 以便配置单元元存储获取新添加的分区信息。这是唯一的方法还是有更好的方法?我担心如果下游用户查询该表,msck repair 是否会导致数据不可用或过时数据出现任何问题?我正在通过HiveContext API 并查看refreshTable 选项。知道改用refreshTable 是否有意义吗?
【问题讨论】:
-
在创建新目录时,您的 Spark Streaming 应用程序是否可以简单地ALTER TABLE ADD PARTITION?我知道 Spark 对 Hive SQL 的支持有限,但有一些解决方法,例如使用 WebHCat...
-
流媒体应用使用 dataframe.write.mode("append").partitionBy(partitionKeys).parquet(baseDirectory) spark 在内部负责添加外部 parquet 文件夹。只是想知道 msck 修复是否是唯一的选择。
标签: apache-spark hive hivecontext hive-partitions