【问题标题】:calico-etcd not scheduled on GKE 1.11 k8scalico-etcd 未安排在 GKE 1.11 k8s 上
【发布时间】:2023-04-02 00:28:01
【问题描述】:

我最近将我的 GKE 集群从 1.10.x 升级到 1.11.x,从那时起,我的 calico-node pod 无法连接到 etcd 集群,并且由于 livenessProbe 错误而最终进入 CrashLoopBackOff

我看到calico-etcd DaemonSet 的期望状态为 0,我对此感到疑惑。 nodeSelector 位于node-role.kubernetes.io/master=

来自calico-nodes这样的日志:

2018-12-19 19:18:28.989 [INFO][7] etcd.go 373: Unhandled error: client: etcd cluster is unavailable or misconfigured; error #0: client: endpoint http://10.96.232.136:6666 exceeded header timeout

2018-12-19 19:18:28.989 [INFO][7] startup.go 254: Unable to query node configuration Name="gke-brokerme-ubuntu-pool-852d0318-j5ft" error=client: etcd cluster is unavailable or misconfigured; error #0: client: endpoint http://10.96.232.136:6666 exceeded header timeout

DaemonSet 的状态:

NAME                       DESIRED   CURRENT   READY   UP-TO-DATE   AVAILABLE   NODE SELECTOR                                  AGE
calico-etcd                0         0         0       0            0           node-role.kubernetes.io/master=                3d
calico-node                2         2         0       2            0           <none>                                         3d

k get nodes --show-labels:

NAME                                     STATUS   ROLES    AGE   VERSION         LABELS
gke-brokerme-ubuntu-pool-852d0318-7v4m   Ready    <none>   4d    v1.11.5-gke.5   beta.kubernetes.io/arch=amd64,beta.kubernetes.io/fluentd-ds-ready=true,beta.kubernetes.io/instance-type=n1-standard-2,beta.kubernetes.io/os=linux,cloud.google.com/gke-nodepool=ubuntu-pool,cloud.google.com/gke-os-distribution=ubuntu,failure-domain.beta.kubernetes.io/region=europe-west1,failure-domain.beta.kubernetes.io/zone=europe-west1-b,kubernetes.io/hostname=gke-brokerme-ubuntu-pool-852d0318-7v4m,os=ubuntu
gke-brokerme-ubuntu-pool-852d0318-j5ft   Ready    <none>   1h    v1.11.5-gke.5   beta.kubernetes.io/arch=amd64,beta.kubernetes.io/fluentd-ds-ready=true,beta.kubernetes.io/instance-type=n1-standard-2,beta.kubernetes.io/os=linux,cloud.google.com/gke-nodepool=ubuntu-pool,cloud.google.com/gke-os-distribution=ubuntu,failure-domain.beta.kubernetes.io/region=europe-west1,failure-domain.beta.kubernetes.io/zone=europe-west1-b,kubernetes.io/hostname=gke-brokerme-ubuntu-pool-852d0318-j5ft,os=ubuntu

我没有修改任何印花布清单,它们应该是由 GKE 提供的 1:1 配置。

我希望calico-nodes 连接到我的 Kubernetes 集群的 etc,或者连接到 DaemonSet 提供的 calico-etcd。由于在 GKE 中没有我可以控制的主节点,我有点明白为什么 calico-etcd 处于状态 0,但是,calico-nodes 应该连接到哪个等?我的小型基本设置有什么问题?

【问题讨论】:

    标签: kubernetes google-kubernetes-engine etcd project-calico calico


    【解决方案1】:

    我们知道 GKE 1.11.x 中的 calico 崩溃循环问题。您可以通过升级到较新版本来解决此问题。 ,我建议你升级到没有这个问题的版本'1.11.4-gke.12'或'1.11.3-gke.23'。

    【讨论】:

    • 我目前使用的是最新版本,即v1.11.5-gke.5。正如我预期的那样,这可能是一个 GKE 问题,我在此处发布之前至少等待了一次升级。但是,不幸的是,问题仍然存在。
    • 我正在与您分享这个public tracker,看看其他人是如何解决这个问题的。正如您在链接中看到的,将 master 升级到 1.11.5-gke.4 应该可以解决 Calico 问题。如果您仍然受到影响,您可以使用public issue 报告错误,通过“计算”、“Google Kubernetes Engine 问题”部分以及您重现的具体步骤。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-05-30
    • 2020-08-29
    • 1970-01-01
    • 1970-01-01
    • 2015-12-23
    相关资源
    最近更新 更多