【发布时间】:2020-03-09 15:04:59
【问题描述】:
我在 kubernetes GKE 集群上运行一个部署的 2 个 pod。我已将此无状态部署副本扩展到 2 个。
两个副本几乎同时启动,两者都在重述错误代码 137 ERROR。为了更改重启时间,我手动删除了一个 pod,以便 RS(replicaset)创建新的。
现在两个 pod 再次同时重新启动。他们之间有什么联系吗?两者都必须独立工作。
我没有设置资源限制。在高达 3 GB 的集群可用空间中,部署不占用太多内存仍然获得 137 并在 pod 中重新启动。
为什么两个 pod 同时重启,这是个问题?其他所有 15 个微服务都运行良好。
【问题讨论】:
-
检查 OOM 的节点日志,您的节点可能内存不足,这两个 pod 的优先级可能较低(尤其是在没有定义资源请求/限制的情况下)
标签: docker kubernetes google-kubernetes-engine nginx-ingress