【发布时间】:2018-01-06 11:50:54
【问题描述】:
我目前正在 BigQuery 中设计一个数据仓库。我打算存储用户数据,例如过去的购买或废弃的购物车。
这似乎非常适合手动分析趋势并获得洞察力。但是,如果我想利用机器学习,例如向一组用户推荐产品? 我研究过 Google ML Engine 和 TensorFlow,似乎 TensorFlow 模型需要先查询 BigQuery。在某些情况下,这可能意味着 TensorFlow 需要查询存储在 BigQuery 中的全部或大部分数据。
这感觉有点不对劲,所以我想知道这是否真的是事情应该发生的方式。否则,我假设我的 ML 模型将不得不处理陈旧的数据?
【问题讨论】:
-
在我们公司,我们也有一个 BQ DW,我们也用它来构建模型。我们所做的大部分工作是让一些 GAE 每日 cron 为我们在其他 BQ 表中构建的每个算法准备数据,以便在模型运行时所有数据都已经设置好。我写了一个blog post,介绍了我们如何在 GCP 中实现我们的推荐系统,它使用 Dataproc,但您仍然可以看到我们如何每天准备数据。它也可能对您在用例中应该如何做有所帮助。
-
@WillianFuks - 在 Stack Overflow 之外与您联系的最佳方式是什么?想问你一些事情。
-
@GrahamPolley Hi Graham :),如果你想要我的电子邮件是 gmail 中的 willian.fuks 或 skype 也是这个名字。
-
酷。在 Skype 上联系你 @WillianFuks
-
@WillianFuks,很棒的博文,非常相关。如果您将数据直接保存到 Cloud Spanner 或 Datastore 而不是 BigQuery 中,这项任务会更容易吗?如果我打算大量使用 ML 数据,我想知道 BigQuery 是否不是最佳存储引擎
标签: machine-learning google-bigquery google-cloud-platform