【发布时间】:2020-08-09 17:25:29
【问题描述】:
我有一个启用了监控和日志记录的 GKE 集群 (1.15)。 到目前为止,我们已经使用 metrics-server 在 stackdriver 上进行指标监控。 对于其他自定义指标,我们使用了 custom-metrics-adapter 来抓取指标并使用 prometheus-to-sd 将它们导出到 stackdriver。
我想开始看看 prometheus 是否可以为我们提供其他功能,例如 HPA 的聚合指标。
在 GCP 市场上,可以选择在 GKE 集群上部署“prometheus + Grafana”。 这基本上安装了几个组件:prometheus server + node exporters + alertsmanager + grafana + kube-state-metrics)。
我想了解的是,如果在度量服务器旁边安装 prometheus 是否是资源度量的一种重复。我的意思是,如果节点和工作负载的 cpu/mem 的默认资源监控是 metric-server 并且我们已经在 stackdriver 上拥有这种指标,并且默认的 prometheus.yaml 包括来自 kubernetes API 的 cpu/mem 资源指标,我们会有该信息的重复指标? (假设我们将添加将全部导出到 stackdriver 的 stackdriver-prometheus)
最佳实践是否应该通常是禁用 metrics-server 并让 prometheus 成为集群上唯一的监控解决方案,同时包括 prometheus-k8s-adapter? 还是我们应该禁用 prometheus.yaml 上的这些部分以不包含这些资源指标?
另外,是否所有 prometheus 指标都将被定义为外部指标并包含额外费用?
谢谢!
【问题讨论】:
标签: google-kubernetes-engine prometheus