【发布时间】:2020-12-01 05:18:08
【问题描述】:
我有按 ts_date 和 orid 分区的配置单元数据,下面是文件的示例云存储 url
myhivepartionedbucket/crunched-logs/mrs-suds-sloaders/loader-log/output/{year}/{month}/{Day}/{Hour}/{Min}/ts_date={yyyy-mm-dd}/orid={orid}/file.orc
以下是生产中的云存储实际网址
myhivepartionedbucket/crunched-logs/mrs-suds-sloaders/loader-log/output/2020/08/06/00/30/ts_date=2020-08-05/orid=6691/part-202008060030.orc
这种结构将存在于每个月的所有日子里,所有 orid 的每个小时都间隔 24 小时
现在我们要安排将此类数据加载到大查询中,按 ts_date 分区,按 orid 聚类。
我已经在控制台上尝试了一个没有分区的文件,我能够加载数据,但是我怎样才能通过 ts_date 的分区和集群的方式定期安排和加载此类数据orid。
我是 GCP 的新手,对 google 提供的文档理解不够,所以有人可以指导或给我一些想法,让我在 UI 或 python 程序上运行
提前致谢
【问题讨论】:
标签: google-cloud-platform hive google-bigquery google-cloud-storage