【问题标题】:How to resolve the cassandra node issue如何解决 cassandra 节点问题
【发布时间】:2020-06-28 04:17:24
【问题描述】:

我创建了一个三个 Cassandra 节点,最初它工作正常,但现在有 2 个节点停止工作。 我试过了

sudo service dse stop

sudo service dse start

出现以下错误

Job for dse.service failed because the control process exited with error code.
See "systemctl status dse.service" and "journalctl -xe" for details.
systemctl status dse.service
● dse.service - LSB: DataStax Enterprise
   Loaded: loaded (/etc/init.d/dse; generated)
   Active: failed (Result: exit-code) since Tue 2020-03-17 04:34:24 UTC; 4min 43s ago
     Docs: man:systemd-sysv-generator(8)
  Process: 4263 ExecStop=/etc/init.d/dse stop (code=exited, status=0/SUCCESS)
  Process: 11273 ExecStart=/etc/init.d/dse start (code=exited, status=1/FAILURE)
    Tasks: 0 (limit: 4915)
   CGroup: /system.slice/dse.service

Mar 17 04:34:14 cstar-node1 su[11442]: pam_unix(su:session): session closed for user cassandra
Mar 17 04:34:14 cstar-node1 su[11456]: Successful su for cassandra by root
Mar 17 04:34:14 cstar-node1 su[11456]: + ??? root:cassandra
Mar 17 04:34:14 cstar-node1 su[11456]: pam_unix(su:session): session opened for user cassandra by (uid=0)
Mar 17 04:34:14 cstar-node1 su[11456]: pam_unix(su:session): session closed for user cassandra
Mar 17 04:34:24 cstar-node1 dse[11273]: ERROR: DSE failed to start. Please check your logs.
Mar 17 04:34:24 cstar-node1 dse[11273]:    ...fail!
Mar 17 04:34:24 cstar-node1 systemd[1]: dse.service: Control process exited, code=exited status=1
Mar 17 04:34:24 cstar-node1 systemd[1]: dse.service: Failed with result 'exit-code'.
Mar 17 04:34:24 cstar-node1 systemd[1]: Failed to start LSB: DataStax Enterprise.

只有一个节点是 UP

nodetool status
Datacenter: Cassandra
=====================
Status=Up/Down
|/ State=Normal/Leaving/Joining/Moving
--  Address       Load       Tokens       Owns    Host ID                               Rack
DN  X.X.X.X   ?          1            ?       46fdfb5e-238c-476b-a243-184a530fg30e  rack1
UN  X.X.X.Y  207.4 KiB  1            ?       7fasd242-891d-4ecf-ggef-0f8hffarr434  rack1
DN  X.X.X.Z  ?          1            ?       34ffda2f-46d2-443d-4546-33c55cface2c  rack1

如何解决这个错误?谁能帮帮我。

提前致谢。

【问题讨论】:

  • 详情请关注/var/log/system.log...
  • 请从 system.log 将错误粘贴到此处。

标签: cassandra cassandra-3.0 cqlsh nodetool


【解决方案1】:

这是不久前的事了——所以即使它不再对你有帮助,也可能对其他人有帮助。我遇到了同样的问题,但 cassandra 日志和系统日志中都没有任何条目。启动过程也因上面的非描述性消息而失败。要解决我一直在停止的问题(以 root 身份):

  • 代理:systemctl stop datastax-agent
  • dse 服务:systemctl stop dse

然后删除PID所在的目录:

  • /var/run/datastax-agent
  • /var/run/dse

最后重新启动了这两个服务。这对我有用。我不能说删除 PID 或重新启动 datastax-agent 是否真的解决了问题,但我的盲目猜测会落在 PID 上。

【讨论】:

  • 你是怎么想出这个技巧的?
  • 嗯,我们的集群经常崩溃,因为我们的环境有点热问题。一旦它崩溃并且无法再启动,没有任何有用的错误消息。因此,在多次尝试重启后,我们查看了启动脚本,发现它正在寻找可用的 PID,即使进程根本没有运行,然后停止执行启动序列。
猜你喜欢
  • 2012-11-19
  • 2014-01-07
  • 2019-08-18
  • 1970-01-01
  • 2019-11-07
  • 2015-06-09
  • 1970-01-01
  • 1970-01-01
  • 2021-07-15
相关资源
最近更新 更多