【发布时间】:2020-11-16 09:07:31
【问题描述】:
我有一个如下所示的 Cloud Dataflow 管道:
- 从 Cloud PubSub 读取
- 做一些转换并编写 CloudSql 和 GCS
最初没有设置任何最大工人数和工人数,它工作正常,但处理大型数据集需要很长时间,然后我指定一些 maxNumWorkers 说 60 和 numWorkers 到 6,这很好,但我们在处理结束时丢失了很多数据
我们也试过这个
--autoscaling_algorithm=THROUGHPUT_BASED --max_num_workers=5
作业仍然从一名工人开始,并且不会自动扩展。
但是,Dataflow 工作人员似乎并没有自动启动和平衡负载。
【问题讨论】:
标签: google-cloud-dataflow apache-beam dataflow