【问题标题】:Need help building an uptime dashboard for a distributed system需要帮助为分布式系统构建正常运行时间仪表板
【发布时间】:2021-01-04 23:02:44
【问题描述】:

我有一个产品,我想为其创建一个仪表板来显示 其可用性/正常运行时间随时间变化并显示任何中断。

特别是我正在寻找的

  • 能够报告服务正常运行时间的历史信息
  • 提供任何服务中断的详细信息

该产品在一组 linux 服务器上运行并连接到正在运行的数据库 在一个单独的实例上,我们还有一些每晚运行的专用实例 批处理作业。我的系统也依赖一些外部服务来提供 为特定客户提供的附加功能。也有redis缓存 为多个客户缓存数据。

我们复制上述所有设置(应用程序服务器、数据库、作业服务器、redis 缓存等)到大客户的专用集群中。小客户被放 在其中一个共享集群上以保持低成本。

目前我们仅在应用服务器上运行健康检查并提供 这些信息在一个简单的 HTML 页面中。这是最终用户/客户的转到页面 和支持团队。

由于产品是使用多个系统/服务构建的,因此我们当前的 HTML 页面经常说系统启动并运行良好,同时可以体验 它的某些组件或外部服务存在问题。

当前运行状况检查使用简单的 HTTP 请求并查找 200 状态码,此检查每分钟运行一次,我们将这些数据绘制成一个简单的 图表显示过去 30 天。我们还显示了带有时间戳的中断列表和 手动添加的附加静态信息。

我们希望构建一个更强大的解决方案,该解决方案监控的内容远不止 HTTP 端口 以及我们在哪里有更多细节,比如哪一部分 系统存在问题以及这些问题如何影响系统和 哪些客户受到影响。

感谢任何指导或帮助。我们更喜欢使用 开源工具,因为我们没有太多预算。目标是改善事物 我的团队成员已经超负荷了。

【问题讨论】:

    标签: web-services monitoring distributed-system uptime-monitoring observability


    【解决方案1】:

    鉴于我不了解您的产品,我不确定这对于您的设置是否过大,但请查看 ELK 堆栈,看看您是否可以使用一些组件或至少一些想法从那里:

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-17
      • 2012-04-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多