【发布时间】:2021-01-04 23:02:44
【问题描述】:
我有一个产品,我想为其创建一个仪表板来显示 其可用性/正常运行时间随时间变化并显示任何中断。
特别是我正在寻找的
- 能够报告服务正常运行时间的历史信息
- 提供任何服务中断的详细信息
该产品在一组 linux 服务器上运行并连接到正在运行的数据库 在一个单独的实例上,我们还有一些每晚运行的专用实例 批处理作业。我的系统也依赖一些外部服务来提供 为特定客户提供的附加功能。也有redis缓存 为多个客户缓存数据。
我们复制上述所有设置(应用程序服务器、数据库、作业服务器、redis 缓存等)到大客户的专用集群中。小客户被放 在其中一个共享集群上以保持低成本。
目前我们仅在应用服务器上运行健康检查并提供 这些信息在一个简单的 HTML 页面中。这是最终用户/客户的转到页面 和支持团队。
由于产品是使用多个系统/服务构建的,因此我们当前的 HTML 页面经常说系统启动并运行良好,同时可以体验 它的某些组件或外部服务存在问题。
当前运行状况检查使用简单的 HTTP 请求并查找 200 状态码,此检查每分钟运行一次,我们将这些数据绘制成一个简单的 图表显示过去 30 天。我们还显示了带有时间戳的中断列表和 手动添加的附加静态信息。
我们希望构建一个更强大的解决方案,该解决方案监控的内容远不止 HTTP 端口 以及我们在哪里有更多细节,比如哪一部分 系统存在问题以及这些问题如何影响系统和 哪些客户受到影响。
感谢任何指导或帮助。我们更喜欢使用 开源工具,因为我们没有太多预算。目标是改善事物 我的团队成员已经超负荷了。
【问题讨论】:
标签: web-services monitoring distributed-system uptime-monitoring observability