【发布时间】:2020-07-28 20:39:19
【问题描述】:
在具有多个节点并在 RWO 模式下使用 Ceph 块卷的环境中,如果某个节点发生故障(无法访问且不会很快恢复)并且 Pod 被重新调度到另一个节点,则 Pod 无法启动:它有一个 Ceph 块 PVC。原因是该卷被另一个 pod '仍在使用'(因为节点发生故障,它的资源无法正确移除)。
如果我使用 kubectl delete node dead-node 从集群中删除节点,则 pod 可以启动,因为资源已被删除。
如何自动执行此操作?我想过的一些可能性是:
- 我可以为卷设置强制分离超时吗?
- 设置删除节点超时?
- 自动删除具有给定污点的节点?
我可以将ReadWriteMany模式与其他volume类型一起使用,可以让PV被多个pod使用,但并不理想。
【问题讨论】:
标签: kubernetes ceph