【问题标题】:incorrect merge views with infinispan and jgroups使用 infinispan 和 jgroups 合并视图不正确
【发布时间】:2017-03-22 09:24:08
【问题描述】:

我有一个 numOwners=2 的 3 节点 infinispan 集群,当其中一个节点与网络断开连接并重新加入时,我遇到了集群视图问题。以下是日志:

(Incoming-1,BrokerPE-0-28575) ISPN000094: 收到频道 ISPN 的新集群视图:[BrokerPE-0-28575|2] (3) [BrokerPE-0-28575, SEM03VVM-201-59385、SEM03VVM-202-33714]

ISPN000094:收到频道 ISPN 的新集群视图:[BrokerPE-0-28575|3] (2) [BrokerPE-0-28575, SEM03VVM-202-33714] -- > 一个节点断开

ISPN000093:收到频道 ISPN 的新合并集群视图:MergeView::[BrokerPE-0-28575|4] (2) [BrokerPE-0-28575, SEM03VVM-201-59385],2 个子组:[BrokerPE- 0-28575|3] (2) [BrokerPE-0-28575, SEM03VVM-202-33714], [BrokerPE-0-28575|2] (3) [BrokerPE-0-28575, SEM03VVM-201-59385, SEM03VVM- 202-33714] -->不正确的合并

以下是我的 jgroups 配置:

<config xmlns="urn:org:jgroups"
        xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
        xsi:schemaLocation="urn:org:jgroups http://www.jgroups.org/schema/jgroups-3.6.xsd">
   <TCP
          bind_addr="${jgroups.tcp.address:127.0.0.1}"
        bind_port="${jgroups.tcp.port:7800}"
        loopback="true"
        port_range="30"
        recv_buf_size="20m"
        send_buf_size="640k"
        max_bundle_size="31k"
        use_send_queues="true"
        enable_diagnostics="false"
        sock_conn_timeout="300"
        bundler_type="old"

        thread_naming_pattern="pl"

        timer_type="new3"
         timer.min_threads="4"
         timer.max_threads="10"
         timer.keep_alive_time="3000"
         timer.queue_max_size="500"


        thread_pool.enabled="true"
        thread_pool.min_threads="2"
        thread_pool.max_threads="30"
        thread_pool.keep_alive_time="60000"
        thread_pool.queue_enabled="true"
        thread_pool.queue_max_size="100"
        thread_pool.rejection_policy="Discard"

        oob_thread_pool.enabled="true"
        oob_thread_pool.min_threads="2"
        oob_thread_pool.max_threads="30"
        oob_thread_pool.keep_alive_time="60000"
        oob_thread_pool.queue_enabled="false"
        oob_thread_pool.queue_max_size="100"
        oob_thread_pool.rejection_policy="Discard"

        internal_thread_pool.enabled="true"
        internal_thread_pool.min_threads="1"
        internal_thread_pool.max_threads="10"
        internal_thread_pool.keep_alive_time="60000"
        internal_thread_pool.queue_enabled="true"
        internal_thread_pool.queue_max_size="100"
        internal_thread_pool.rejection_policy="Discard"
        />

   <!-- Ergonomics, new in JGroups 2.11, are disabled by default in TCPPING until JGRP-1253 is resolved -->
   <TCPPING timeout="3000" initial_hosts="${jgroups.tcpping.initial_hosts:HostA[7800],HostB[7801]}"
            port_range="2"
            num_initial_members="3"
            ergonomics="false"
        /> 

   <!-- MPING bind_addr="${jgroups.bind_addr:127.0.0.1}" break_on_coord_rsp="true"
      mcast_addr="${jboss.default.multicast.address:228.2.4.6}"
      mcast_port="${jgroups.mping.mcast_port:43366}"
      ip_ttl="${jgroups.udp.ip_ttl:2}"
      num_initial_members="3"/-->
     <!--  <MPING bind_addr="${jgroups.bind_addr:127.0.0.1}" break_on_coord_rsp="true"
      mcast_addr="${jboss.default.multicast.address:228.2.4.6}"
      mcast_port="${jgroups.mping.mcast_port:43366}"
      ip_ttl="${jgroups.udp.ip_ttl:2}"
      num_initial_members="3"/> -->
   <MERGE3 max_interval="30000" min_interval="10000"/>

   <FD_SOCK bind_addr="${jgroups.bind_addr}"/> 
    <FD timeout="3000" max_tries="3"/> 
   <VERIFY_SUSPECT timeout="3000"/>
  <!--  <BARRIER /> -->
    <!-- <pbcast.NAKACK use_mcast_xmit="false" retransmit_timeout="300,600,1200,2400,4800" discard_delivered_msgs="true"/> -->
   <pbcast.NAKACK2 use_mcast_xmit="false"
                   xmit_interval="1000"
                   xmit_table_num_rows="100"
                   xmit_table_msgs_per_row="10000"
                   xmit_table_max_compaction_time="10000"
                   max_msg_batch_size="100" discard_delivered_msgs="true"/>
   <UNICAST3 xmit_interval="500"
             xmit_table_num_rows="20"
             xmit_table_msgs_per_row="10000"
             xmit_table_max_compaction_time="10000"
             max_msg_batch_size="100"
             conn_expiry_timeout="0"/>

   <pbcast.STABLE stability_delay="1000" desired_avg_gossip="50000" max_bytes="400000"/>
   <pbcast.GMS print_local_addr="true" join_timeout="3000" view_bundling="true" merge_timeout="6000"/>
   <tom.TOA/> <!-- the TOA is only needed for total order transactions-->

    <UFC max_credits="2m" min_threshold="0.40"/> 
   <!-- <MFC max_credits="2m" min_threshold="0.40"/> -->
   <FRAG2 frag_size="30k"/>
    <RSVP timeout="60000" resend_interval="500" ack_on_delivery="false" /> 
   <!-- <pbcast.STATE_TRANSFER/> -->
</config>

我正在使用 Infinispan 7.0.2 和 jgroups 3.6.1 版本。我尝试了很多配置,但没有任何效果。您的帮助将不胜感激。

[更新] 将以下属性设置为大于 1 后一切正常:“internal_thread_pool.min_threads”。

【问题讨论】:

  • 您是否尝试过使用较新的 Infinispan 版本,例如8.2.4.决赛?
  • @DanBerindei 我没有,但这里的问题似乎与 jgroups 集群合并有关。
  • @DanBerindei 我们也尝试了 Infinispan 8.2.4 并遇到了同样的问题。

标签: java distributed infinispan jgroups


【解决方案1】:

所以为了简化,我们有

  • 查看代理|2={broker,201,202}
  • 201 离开,视图现在是 broker|3={broker,202}
  • 然后是views broker|3和broker|2合并,导致view broker|4={broker,201}

我创建了 [1] 来调查这里发生了什么。首先,合并视图的子视图应该包含 202 作为子组协调员,但事实并非如此。

你能描述一下这里到底发生了什么吗?这可以复制吗?最好有 FD、FD_ALL、MERGE3 和 GMS 的 TRACE 级别日志...

[1]https://issues.jboss.org/browse/JGRP-2128

【讨论】:

  • 是的,当我们手动断开一个节点与网络的连接并将其重新连接时,这在我们的环境中一直是可重现的。感谢您创建错误;我会将跟踪日志添加到其中。
猜你喜欢
  • 2016-12-03
  • 2017-11-09
  • 2013-07-19
  • 2016-06-21
  • 2020-07-31
  • 2015-01-02
  • 1970-01-01
  • 2014-11-21
  • 1970-01-01
相关资源
最近更新 更多