【发布时间】:2015-01-13 21:43:39
【问题描述】:
我有一个 Google Analytics (GA) 帐户,用于跟踪应用的用户活动。我设置了 BigQuery,以便可以访问原始 GA 数据。每天都有数据从 GA 传入 BigQuery。
我有一个以编程方式查询 BigQuery API 的 Python 应用。这个应用程序正在给我所需的响应,这取决于我要查询的内容。
我的下一步是从 BigQuery 获取这些数据并将其转储到 Hadoop 集群中。我想理想地使用数据创建一个配置单元表。我想围绕 python 应用程序构建类似 ETL 过程的东西。例如,我每天都会运行 etl 进程,该进程运行 python 应用程序并将数据导出到集群。
最终,这个 ETL 过程应该放在 Jenkins 上,并且应该能够在生产系统上运行。
在规划此 ETL 流程时,我需要考虑哪些架构/设计/一般因素?
关于我应该如何处理这件事有什么建议吗?我有兴趣以最简单可行的方式做到这一点。
提前致谢。
【问题讨论】:
标签: python hadoop google-analytics google-bigquery etl