【发布时间】:2019-02-20 21:04:19
【问题描述】:
我已经到处找了一个小时左右。我以为我在这里看到了什么,但我找不到。
我正在寻找 nagios.log 的记录定义。具体来说,我试图弄清楚数字代表什么。在这篇文章中,我想了解“1”是什么。
[1549377065] 服务警报:esgg;HTTP;CRITICAL;SOFT;1;CRITICAL - 套接字超时
我以为这很容易找到,但我错了,或者只是在树林里迷路了。
【问题讨论】:
我已经到处找了一个小时左右。我以为我在这里看到了什么,但我找不到。
我正在寻找 nagios.log 的记录定义。具体来说,我试图弄清楚数字代表什么。在这篇文章中,我想了解“1”是什么。
[1549377065] 服务警报:esgg;HTTP;CRITICAL;SOFT;1;CRITICAL - 套接字超时
我以为这很容易找到,但我错了,或者只是在树林里迷路了。
【问题讨论】:
与Nagios中的soft&hard机制有关。
例如,如果您的服务 esgg 在您的服务定义中有 max_check_attempts 3 设置,那么您将看到如下内容:
[1549377065] SERVICE ALERT: esgg;HTTP;CRITICAL;SOFT;1;CRITICAL - Socket timeout
[1549377195] SERVICE ALERT: esgg;HTTP;CRITICAL;SOFT;2;CRITICAL - Socket timeout
[1549377265] SERVICE ALERT: esgg;HTTP;CRITICAL;HARD;3;CRITICAL - Socket timeout
您需要 3 次不良连续检查才能获得 HARD 状态和通知。
【讨论】:
在 Nagios 服务定义中,您已设置“检查间隔”、“重试间隔”和“最大检查尝试次数”。换句话说,nagios 将每隔check interval 分钟检查一次服务,如果不正常,它将每retry interval 分钟再次检查一次,max check attempts 次。您所指的数字是 Nagios 自进入“非 OK”状态以来检查该服务的次数。它将递增,直到达到max check attempts 或回到 OK 状态。
【讨论】: