【问题标题】:AWS Cloudwatch alarm not working: For last few days, alarm stays "OK" even when it passes thresholdAWS Cloudwatch 警报不起作用:过去几天,警报保持“正常”,即使它超过阈值
【发布时间】:2021-01-30 05:18:25
【问题描述】:

我有一个警报,几个月来一直正常工作以管理我的 ASG 的大小。但是,从星期一(10 月 12 日)开始,它就停止了工作。即使图表清楚地显示它高于阈值,它也会保持在“OK”状态。请参阅随附的屏幕截图。

可能会或可能不会相关的是警报将触发,然后失败且没有错误消息。在 ASG 的冷却阶段触发警报时,似乎会发生这种情况。一旦发生这种情况,警报将恢复为“正常”,然后无限期地停留在那里,即使它高于阈值。在星期一之前,它会一直处于警报状态,反复重新触发,直到 ASG 离开冷却状态。

有人知道这里发生了什么吗?我怎样才能解决这个问题?为什么在我这边没有变化的时候突然变了?

【问题讨论】:

    标签: amazon-web-services amazon-cloudwatch cloudwatch-alarms


    【解决方案1】:

    我可以在 15:15 左右看到一些缺失数据,并且您的缺失数据处理设置为“将缺失数据视为良好”,我们是否应将其更改为“将缺失数据视为忽略(保持警报状态)”并检查?

    【讨论】:

    • 丢失的数据发生了,它一直存在,我很确定它只是在提交新指标时出现抖动。 “将丢失的数据视为好”确实会在一段时间内将其切换为“好”,但一旦数据恢复,它就应该反弹到警报状态。但是您是对的,最好将其设置为忽略;我会做出改变,虽然我不认为它会解决这里的大问题。
    • 嗯,今天早上它又开始工作了。是换了国旗吗?也许吧,但我真的不这么认为,因为几个月来它一直在使用设置为“将失踪视为好”的标志。我怀疑新警报或 ASG 代码的推出打破了这一点,然后它被修复了。但无论如何,由于它正在工作并且没有其他人给出更好的(或任何!)答案,我会将您的建议标记为解决方案。谢谢!
    猜你喜欢
    • 1970-01-01
    • 2019-08-01
    • 1970-01-01
    • 2021-05-25
    • 2019-07-14
    • 1970-01-01
    • 1970-01-01
    • 2020-04-10
    • 1970-01-01
    相关资源
    最近更新 更多