【问题标题】:Job-Manager is not recovering Zookeeper checkpointsJob-Manager 没有恢复 Zookeeper 检查点
【发布时间】:2018-11-29 17:08:27
【问题描述】:

我们在 K8s 环境中部署了 Flink 作业集群(1 个作业管理器和 1 个任务管理器),并将其配置为 HA 模式(连接到 Zookeeper)。该作业是有​​状态的,并且使用 RocksDB 后端启用了检查点。问题是任务管理器重新启动从最后一个检查点正确恢复,但作业管理器重新启动不是:

[flink-akka.actor.default-dispatcher-5]recover: 2018-11-27 11:23:26,531 INFO  o.a.f.r.c.ZooKeeperCompletedCheckpointStore Recovering checkpoints from ZooKeeper.
[flink-akka.actor.default-dispatcher-5]recover: 2018-11-27 11:23:26,596 INFO  o.a.f.r.c.ZooKeeperCompletedCheckpointStore Found 0 checkpoints in ZooKeeper.
[flink-akka.actor.default-dispatcher-5]recover: 2018-11-27 11:23:26,597 INFO  o.a.f.r.c.ZooKeeperCompletedCheckpointStore Trying to fetch 0 checkpoints from storage.

检查点被持久化到 Google Cloud Storage 和 Zookeeper。

flink-conf.yaml中的相关属性:

metrics.reporters: prom
metrics.reporter.prom.class: org.apache.flink.metrics.prometheus.PrometheusReporter
high-availability: zookeeper
high-availability.zookeeper.quorum: our-k8s-zookeeper-service:2181
high-availability.zookeeper.path.root: /flink
high-availability.cluster-id: /service_cluster
high-availability.storageDir: gs://our-flink-bucket/namespace/service/ha
high-availability.jobmanager.port: 6123
state.backend.fs.memory-threshold: 0
state.checkpoints.dir: gs://our-flink-bucket/namespace/service/checkpoints

我们在这里缺少什么?

【问题讨论】:

    标签: apache-flink


    【解决方案1】:

    终于找到了问题所在,似乎是 Flink 1.6.1 中的一个 bug (this one)。

    升级到 1.6.2 解决了。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-12-26
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-07-30
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多