【发布时间】:2019-08-15 16:55:06
【问题描述】:
我在 GCS 中有不断增长的数据,并且会有一个批处理作业运行,比如说每天处理 100 万篇文章增量。我需要从 BigTable(包含数十亿条记录)中获取键的附加信息。对地图操作中的每个项目进行查找是否可行?批处理这些查找并执行诸如批量读取之类的操作是否有意义?或者对于这个用例使用 scio/beam 的最佳方式是什么?
我在Pattern: Streaming mode large lookup tables 中发现,推荐对每个请求执行查找以进行流式传输,但我不确定我是否不会通过批处理作业重载 BigTable。
你们对如何处理这个用例有任何总体或具体的建议吗?
【问题讨论】:
标签: join google-cloud-dataflow apache-beam google-cloud-bigtable spotify-scio