【发布时间】:2015-01-19 09:13:36
【问题描述】:
我是一名 NOC 操作员,负责监控亚马逊云应用程序的性能。 Ops 团队使用 Graphite 来监控其运行状况,并在其上使用 Grafana 来渲染精美的图表。通过设计“石墨”每分钟收集一次数据 但是我遇到了 Grafana 的问题,它在最后一分钟呈现不正确的数据(或未完全收集,请参见下面的屏幕截图)。 我可以解决它吗?
【问题讨论】:
-
这些图表是基于多个指标的累积还是其他公式?也许只有一些涉及的指标是 up2date 的,所以你得到的值低于预期......或者它是一个缓存的东西 - Graphite 在内存中大量缓存,但理论上应该可以随时提供 up2date 指标......
-
是的,这些图表汇总了来自许多 VM(数千个)的数据,因此您很可能是对的。有没有办法排除最后一分钟的数据?
-
要解决您的问题,您可以使用
timeShift(your.metric,"1min")及时返回 your.metric。 -
@cmur2,我刚刚在文档中读到了该功能,但没有专心,对此感到抱歉。似乎它不适用于 GroupByNode,这不起作用:
timeShift(groupByNode(agg.*.*.*.*.somedata.*.*.count,2,'sumSeries'),"2min") -
你在使用 statsd 吗?如果是这样,您可能错误地配置了保留率,请参阅github.com/etsy/statsd/blob/master/docs/graphite.md