【问题标题】:Alertmanager repeat_interval and valueAlertmanager repeat_interval 和 value
【发布时间】:2021-12-17 12:00:35
【问题描述】:

我将 $value 放在 prometheus 表达式的标签部分,当 $value 更改时,alertmanager repeat_interval 似乎不起作用。例如,我将“CPU使用率”的threadhold设置为80%。它会在达到 81% 时触发警报,但是当实际 cpu 使用率达到 82% 时会触发另一个警报。 有什么方法可以让 repeat_interval 在值不同时起作用?

【问题讨论】:

  • 请添加Prometheus配置(我不明白“我把$value放在prometheus表达式的标签部分”是什么意思)。
  • 您好 Marcelo,感谢您的快速回复,请参考以下内容: - alert: cpu_usage annotations: description: ({{ $labels.instance }}) summary: cpu_usage{{ $value }}%表达式:| 100 - floor((avg by(instance) (rate(node_cpu_seconds_total{service="node-exporter",mode="idle"}[2m])) * 100)) > 80 用于:0m 标签:服务:节点值: '{{ $value }}'
  • 我将标签中的实际值和持续时间设置为 0m(对于:0m)。目前的问题是:超过threadhold 80之后会触发每一个alert,比如达到81时肯定符合规则触发alert,但是到了82之后又会有alert具有相同的警报名称“cpu_usage”。 repeat_interval 似乎在 alertmanage 配置中不起作用。

标签: prometheus prometheus-alertmanager


【解决方案1】:

Alertmanager 在发现具有不同警报名称或不同标签值的警报规则时创建新警报。

在您的情况下,您设置了以下标签:

labels:
  value: '{{ $value }}'

因此,每次值更改时都会创建一个新警报。

【讨论】:

    猜你喜欢
    • 2021-08-08
    • 1970-01-01
    • 2021-07-13
    • 1970-01-01
    • 1970-01-01
    • 2012-08-12
    • 2016-02-27
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多