【发布时间】:2020-01-14 15:16:49
【问题描述】:
BigQuery 表中有大量(10 到 4000 亿)原始数据。我们需要处理这些数据,以便以星型模式表(可能是 bigquery 中的不同数据集)的形式转换和创建数据,然后 atscale 可以访问这些数据。
需要以下两个选项之间的优缺点:
1. 在BigQuery 中编写复杂的 SQL,从源数据集读取数据,然后加载到目标数据集(由 Atscale 使用)。
2. 将PySpark 或MapReduce 与来自Dataproc 的BigQuery 连接器一起使用,然后将数据加载到BigQuery 目标数据集。
我们转换的复杂性包括以不同的粒度连接多个表、使用分析功能来获取所需的信息等。
目前这个逻辑在 vertica 中使用多个临时表来实现更快的处理,我们希望在 GCP(Big Query 或 Data Proc)中重写这个处理逻辑
【问题讨论】:
-
这个过程多久执行一次?
-
我们正在考虑将它们作为 ETL 负载的一部分每天执行,甚至一天执行多次。
标签: google-bigquery