【问题标题】:monitoring CPU/mem usage on gke监控 gke 上的 CPU/内存使用情况
【发布时间】:2019-03-28 21:45:37
【问题描述】:

我最近在生产环境中使用 gke 和 kubernetes 启动。 我经常停电,没有明显的原因。 没有事件显示任何内容,Pod 没有重新启动并且看起来很稳定。 我有一个类似的 qa env,它完全没有问题,但它更小。

在哪里可以找到有关中断原因的潜在信息?

【问题讨论】:

    标签: kubernetes google-kubernetes-engine


    【解决方案1】:

    堆栈驱动程序让您付费和配置它...kubernetes 附带了一个工具...只需使用它:

    kubectl top nodes

    al@host:~/$ kubectl top nodes
    NAME                             CPU(cores)   CPU%      MEMORY(bytes)   MEMORY%
    gke-learn-pool-1-10f60e0a-s44c   104m         11%       1008Mi          86%
    

    你也可以在集群下->集群->节点->节点

    更新:Stack Driver 已弃用所有负载监控插件。现在是 K8s 或高速公路。

    【讨论】:

      【解决方案2】:

      您可以使用Stackdriver 查看集群的监控数据。在this blog post 中有一个关于如何将其用于 GKE 的简短演练。您可能还想查看一般的Kubernetes application troubleshooting guide。

      停电的症状是什么?

      【讨论】:

      • 我已经看过 stackdriver 以及 kubernetes /ui。我可以在 /ui 上看到 men 使用情况图(非常有限且很小),但我在 stackdriver 的容器级别看不到任何 CPU/mem 信息。中断很简单,443端口的请求超时。也就是说,我还不知道它在哪个级别超时,它似乎在第一层,我自己的 nginx 但我看不到节点上的任何 CPU 压力,日志中没有错误,也没有 CPU 使用率堆栈驱动程序接口上容器级别的详细信息。
      • Stackdriver 确实有每个容器的 CPU 和内存指标。在您的集群视图中,如果您单击一个 pod,则 pod 详细信息页面将有一个容器列表。如果您单击容器,它将仅显示该容器的指标和事件。在博客文章的此屏幕截图中查看 pod 列表? 3.bp.blogspot.com/-RVrPCkoQvGY/VnH2tA8mbJI/AAAAAAAACLQ/…
      • 我看到了 cpu 和 mem 实例。我在容器级别(pod 级别)上看不到它,它对我的​​所有 pod 显示“未找到图表数据”。
      • 是的,你应该是。 1.2 版的集群图表存在问题,现已修复,因此如果您仍然看不到任何内容,请告诉我。感谢您提出这个问题!
      • 每个容器的利用率是使用量除以 pod 清单中指定的限制。如果您的 pod 的 CPU 限制非常小,例如 0.1 个 CPU,那么达到 2500% 的利用率并非不可能,那么如果它使用 2.5 个 CPU,您会看到 2500% 的利用率。这是可能的,因为当前没有强制执行限制,除非存在 CPU 争用。
      猜你喜欢
      • 2012-03-20
      • 1970-01-01
      • 2011-04-30
      • 2015-05-23
      • 1970-01-01
      • 2016-02-19
      • 2020-04-25
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多