【问题标题】:Openshift Online issue: pod with persistent volume failed schedulingOpenshift Online 问题:具有持久卷的 pod 调度失败
【发布时间】:2018-06-07 07:48:22
【问题描述】:

我有一个小型 web 应用程序,可以在 Openshift Online 上正常运行 9 个月,其中包含一个 python 服务和一个 postgresql 数据库(当然还有一个持久卷)

突然,上周二,postgresql pod 停止工作,所以我尝试重新部署服务。现在已经快 2 天了,pod 调度不断失败。我在事件日志中有以下条目:

调度失败 0/110 个节点可用:1 个节点有磁盘压力,5 个节点有 pod 不能容忍的污点,6 个节点不匹配节点选择器,98 个节点(s) 超过最大音量计数。 过去 13 分钟 37 次

因此,它看起来像是 RH 数据中心的“磁盘已满”问题,应该很容易解决,但我在状态页面上没有看到任何通知 (https://status.starter.openshift.com/)

我的问题看起来很像 start-us-west-1 中描述的问题:

正在调查 - 目前 Openshift SRE 团队正在尝试解决此事件。您很有可能在安排带有附加卷的 pod 时遇到困难。 对于给您带来的不便,我们深表歉意。

但我在 starter-ca-central-1 上,不应该受到影响。已经很久了,我想知道 RH 是否有人知道这个问题?但是我找不到与他们联系的方式,以便为具有入门计划的用户提供帮助

有人在 ca-central-1 上遇到同样的问题吗?

【问题讨论】:

标签: openshift


【解决方案1】:

正如格雷厄姆在评论中提到的那样,https://help.openshift.com/forms/community-contact.html 是要走的路

在将我的问题发布到此链接后几个小时(实际上是 12 小时),我收到了 RH 某人的反馈,他说我的请求已被考虑在内。

今天早上,我的应用程序终于启动了,状态页面上的故障通知:

正在调查 - 目前 Openshift SRE 团队正在尝试解决此事件。安排附加卷的 pod 时,您很有可能会遇到困难。 对于给您带来的不便,我们深表歉意。

不知道如果我没有联系他们会发生什么......

【讨论】:

    【解决方案2】:

    在至少 4 个月的正常工作后,我在 Starter US West 1 上运行的应用程序在部署过程中突然开始收到以下错误消息:

    0/106 个节点可用:1 个节点有磁盘压力,29 个节点 超过最大卷数,3 个节点不可调度,4 个节点有 Pod 不能容忍的污点,6 个节点与节点不匹配 选择器,63 cpu 不足。

    在失败开始之前,设置没有任何变化。我已经意识到这个问题只发生在具有持久卷的部署上,比如在我的例子中是 PostgreSQL Persistent。

    我现在通过上述网址提交了这个问题。当我得到一些回应或一些解决方案时,我会在这里发布。

    【讨论】:

    • 响应是:“很遗憾,您正在将项目部署到的 starter-us-west-1 集群当前存在容量问题。通常,在某些时间无法安排 pod。一旦此性能下降报告已标记解决,您应该不再面临调度困难。很抱歉,无法优先考虑某些用户,强行驱逐其他用户的 Pod。请使用“订阅更新”关注报告按钮,以收到有关分辨率的通知。”
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2016-08-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多