【发布时间】:2021-12-17 12:00:35
【问题描述】:
我将 $value 放在 prometheus 表达式的标签部分,当 $value 更改时,alertmanager repeat_interval 似乎不起作用。例如,我将“CPU使用率”的threadhold设置为80%。它会在达到 81% 时触发警报,但是当实际 cpu 使用率达到 82% 时会触发另一个警报。 有什么方法可以让 repeat_interval 在值不同时起作用?
【问题讨论】:
-
请添加Prometheus配置(我不明白“我把$value放在prometheus表达式的标签部分”是什么意思)。
-
您好 Marcelo,感谢您的快速回复,请参考以下内容: - alert: cpu_usage annotations: description: ({{ $labels.instance }}) summary: cpu_usage{{ $value }}%表达式:| 100 - floor((avg by(instance) (rate(node_cpu_seconds_total{service="node-exporter",mode="idle"}[2m])) * 100)) > 80 用于:0m 标签:服务:节点值: '{{ $value }}'
-
我将标签中的实际值和持续时间设置为 0m(对于:0m)。目前的问题是:超过threadhold 80之后会触发每一个alert,比如达到81时肯定符合规则触发alert,但是到了82之后又会有alert具有相同的警报名称“cpu_usage”。 repeat_interval 似乎在 alertmanage 配置中不起作用。
标签: prometheus prometheus-alertmanager