【问题标题】:Dataflow workers are not spinning up数据流工作者没有旋转
【发布时间】:2020-11-16 09:07:31
【问题描述】:

我有一个如下所示的 Cloud Dataflow 管道:

  1. 从 Cloud PubSub 读取
  2. 做一些转换并编写 CloudSql 和 GCS

最初没有设置任何最大工人数和工人数,它工作正常,但处理大型数据集需要很长时间,然后我指定一些 maxNumWorkers 说 60 和 numWorkers 到 6,这很好,但我们在处理结束时丢失了很多数据

我们也试过这个

--autoscaling_algorithm=THROUGHPUT_BASED --max_num_workers=5

作业仍然从一名工人开始,并且不会自动扩展。

但是,Dataflow 工作人员似乎并没有自动启动和平衡负载。

【问题讨论】:

    标签: google-cloud-dataflow apache-beam dataflow


    【解决方案1】:

    我建议您启用 Dataflow Streaming Engine 功能,因为与 Dataflow 工作线程处理和自动缩放的默认架构相比,它可以根据您的管道的 CPU 利用率提供更灵敏的自动缩放性能。

    存在与 Cloud Dataflow 的吞吐量和输入行为相关的问题。您可以跟踪改进here。请点击+1,让 Dataflow 工程团队更容易看到它。

    另外,您可以查看相关资源是否存在配额问题。对于每个作业,Dataflow 都会创建一个实例组。工作虚拟机通过实例组启动,每个工作虚拟机占用资源。所有这些资源(例如实例组、IP 地址、CPU 等)都可以受到配额的限制。关注documentation。我发现与 SO thread 类似,来自 Dataflow Engineer 的回答。

    希望以上信息对您有用。

    【讨论】:

      猜你喜欢
      • 2021-12-17
      • 1970-01-01
      • 2018-05-15
      • 1970-01-01
      • 1970-01-01
      • 2020-03-13
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多