【问题标题】:AWS Cloudwatch Alarm statusAWS Cloudwatch 警报状态
【发布时间】:2018-05-31 12:11:38
【问题描述】:

我已设置 cloudwatch 警报,以在 cloudwatch 日志中发现某些关键字时触发 SNS 邮件。 (使用指标过滤器)

  1. 当检测到这些关键字时,警报状态会从insufficient data变为alarm并触发SNS主题
  2. 现在,从警报状态 alarm 转移到 insufficient data 需要随机时间。

它有什么具体的工作方式吗,我希望它在 alarm 状态之后立即返回到 Alarm 状态 insufficient data

任何帮助将不胜感激。谢谢

【问题讨论】:

  • 你的报警器是什么配置的?你能展示一张图片,或者描述一下吗?这将是某个指标在一段时间内的一些统计数据(例如平均值、总和、计数)。
  • 配置:对于 lambda 日志组,我创建了一个指标过滤器。 指标:Cloudwatch 警报有一个指标过滤器,可从 cloudwatch 日志中检测特定关键字。
  • 警报将在某个时间段内包含某些指标的一些统计信息(例如,平均值、总和、计数)。他们的目标是什么?
  • 统计为 Sum,时间为 1 分钟。
  • 嗯,这意味着如果过去 1 分钟的指标计数总和超过您请求的阈值,则警报将处于 ALARM 状态。如果一分钟内没有没有指标发送,它将返回到 INSUFFICIENT_DATA。

标签: alarm amazon-cloudwatch amazon-cloudwatchlogs


【解决方案1】:

警报的度量周期为 60 秒和一些评估周期(假设为 3;总计等于 3 * 60 = 3 分钟评估窗口)。 如果每隔 60 秒的最后 3 个数据点都处于警报状态(高于阈值),则警报将处于警报状态。 如果最后 3 个数据点中的任何 1 个低于阈值,则警报将转换为 OK。 但是,如果最新的所有 3 个数据点都丢失(比如您的指标过滤器不匹配,因此没有推送指标),警报会等待超过 3 个周期才能转换到 InsufficientData,这是为了适应网络延迟或处理而设计的延迟。

https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/AlarmThatSendsEmail.html

【讨论】:

  • 感谢 ShamSuf 有用的信息!
【解决方案2】:

遇到了同样的情况,使用了 1 分钟的时间和一些 x > 阈值。

只要指标超过阈值,状态就会立即变为警报。但改回 OK/Insufficient 数据需要 6 分钟。这只发生在缺失数据的情况下。

根据 AWS 支持,这是 Cloudwatch 警报的预期行为,可以在此处找到明确的解释 https://forums.aws.amazon.com/thread.jspa?threadID=284182

【讨论】:

  • 我知道这是设计行为。但是肯定有一种方法可以更快地得到警报吗?对我来说,这似乎是一个很常见的情况 - 发布指标的东西坏了,所以你想知道一旦发生这种情况?
猜你喜欢
  • 2021-01-10
  • 2019-07-30
  • 2022-11-30
  • 2020-06-10
  • 1970-01-01
  • 2021-03-28
  • 2021-05-25
  • 2019-07-14
  • 1970-01-01
相关资源
最近更新 更多