【问题标题】:Solr: some replicas goes down during indexing operationsSolr:一些副本在索引操作期间出现故障
【发布时间】:2015-08-14 12:48:40
【问题描述】:

副本关闭,都在同一个 SolrCloud 节点上。它是一个两节点集群(但有三个 zookeeper 实例)。该问题发生在索引操作期间。 down 副本都在同一个 solrcloud 节点 host2 上。 我找不到有关所引发错误的信息。 引发的错误如下:

ERROR - 2015-08-13 02:57:34.261; org.apache.solr.common.SolrException; 
    forwarding update to http://host1:8080/solr/collection_V_2_0_shard1_replica1/ failed - 
    retrying ... retries: 1 add{,id=RFQ||304707||188627||1} params:update.distrib=TOLEADER&distrib.from=http%3A%2F%2Fhost2%3A8080%2Fsolr%2Fak_collection_V_2_0_shard1_replica2%2F 
    rsp:503:org.apache.solr.common.SolrException: Service Unavailable

出错后,collection_V_2_0_shard1_replica2 已关闭。 有人可以帮我找出这个错误的原因吗?

问候 乔瓦

【问题讨论】:

  • 你能解释一下你的分片和副本的数量吗?都在同一个 SolrCloud 上是什么意思?
  • @abhishek bafna:我们有一个两节点集群。每个集合有两个分片。每个分片都在每个节点上进行镜像。一些分片已关闭并且仅在一个节点上关闭。换句话说:一些分片仅在一个节点上发生故障。在另一个节点上一切正常!谢谢!
  • zookeeper 实例的状态如何?在您的情况下,只有部分分片可用。

标签: solr lucene solrcloud


【解决方案1】:

我猜托管 collection_V_2_0_shard1_replica2 的 SOLR 节点由于某种原因已关闭,日志中的错误与节点为何关闭无关,它与副本试图将文档路由到 shard1 领导者有关,似乎领导者已经关闭.

一些调试技巧

  1. 登录到托管 shard1 的节点
  2. 扫描日志文件,查看节点宕机的原因,寻找的时间是在路由时间戳之前(Say Secs/Mins before 2015-08-13 02:57:34.261)
  3. 您是否覆盖了 Java Heap..?默认只有512KB,你可以在solr.in.sh/cmd中改成4g之类的,重启solr
  4. ZooKeepers 那时起床了吗?即使 zooKeeper 关闭,集群也将维持,因为 SOLR 本身具有集群状态 json。但它将无法接受写入。

【讨论】:

  • 谢谢。托管 collection_V_2_0_shard1_replica2 的 Solr 节点没有关闭,因为一些副本已启动并运行。
  • 您是否无法从托管 shard1 replica2...的日志文件中获取任何指针?
猜你喜欢
  • 1970-01-01
  • 2020-09-09
  • 1970-01-01
  • 2019-08-06
  • 1970-01-01
  • 1970-01-01
  • 2021-02-03
  • 1970-01-01
  • 2014-12-05
相关资源
最近更新 更多