【问题标题】:Cluster goes down after PC1 goes downPC1 宕机后集群宕机
【发布时间】:2021-08-24 22:21:09
【问题描述】:

我有两台电脑,我在两个 gfsh 终端上运行以下命令:

开始定位器 --name=locator1 --locators=ipaddress1[10334], ipaddress2[10334] 启动服务器 --name=server1 --locators=ipaddress1[10334], ipaddress2[10334]

在他们启动后,当我列出成员时,我可以在两个终端上看到所有 4 个成员。

现在:
假设我首先在 PC1 上运行这些命令,然后在 PC2 上运行。 (所以PC1是第一个在线的)。 如果我关闭 PC2,模拟 PC 故障,PC1 就可以了。当我列出成员时,它有 2 个(定位器和服务器)。

我启动 PC2 并再次运行命令,再次使用 4 个成员时一切正常。

然而, 如果我关闭 PC1(作为原始集群启动中的第一台 PC),PC2 会在不久之后(大约 5 秒)断开与所有设备的连接。 gfsh 连接已断开,我根本无法连接到本地主机,但服务器和定位器的进程 ID 仍在运行。

它在 LOG(s) Membership Service Failure: Exiting due to possible network partition event due to loss of 2 cache processes.

当我让 PC1 重新联机并运行定位器和服务器命令时,我可以在 PC2 上再次连接。

谁能帮我解决这个问题???我很难弄清楚这里发生了什么。

【问题讨论】:

    标签: geode


    【解决方案1】:

    当超过 52% 的成员法定人数丢失时,Geode 成员会自动关闭,主要是为了防止出现脑裂情况和数据损坏。 你可以在Network Partitioning找到更多细节。

    干杯。

    【讨论】:

    • 使用默认值 enable-network-partition-detection,任何成员在单个成员视图更改(仲裁损失)中检测到总成员权重下降到 51% 以下的任何成员都声明网络分区事件。我在 PC1 和 PC2 上的 gemfire.properties 文件中将此设置为 FALSE。这不会阻止会员法定人数问题吗?
    • 如果您将enable-network-partition-detection 属性设置为false(不推荐),则根本不应该启动仲裁算法。您是否检查了日志以确保属性值更改已生效?
    • 感谢您的发帖。我终于能够让它工作了。我明白不建议这样做。我会定义。生产环境没有这个。基本上只是想为我的小组就这些类型的框架组合一个“演示”。非常感谢您的第一反应并为您提供了很多帮助。谢谢
    猜你喜欢
    • 1970-01-01
    • 2020-10-08
    • 2016-03-22
    • 2019-05-04
    • 2019-11-20
    • 1970-01-01
    • 2016-04-15
    • 2015-03-22
    • 1970-01-01
    相关资源
    最近更新 更多