监控 K8s 集群,必须关注的“黄金指标”有哪些?它们分别来自哪里?
2026-08-11 01:06:54 # 监控

监控一个 K8s 集群,如果眉毛胡子一把抓,很容易淹没在海量指标里。一个成熟的做法是按资源、状态、业务三个维度去组织“黄金指标”。

一、资源指标(来自 cAdvisor 和 node-exporter)

反映“机器/容器资源是否够用”:

  • CPU / 内存使用率
  • CPU 节流(Throttling):容器被 cgroup 限流的次数,常常比 CPU 使用率更能暴露性能问题
  • 网络吞吐量
  • 磁盘 I/O

二、状态指标(来自 kube-state-metrics)

直接反映“服务是否可用”:

  • Pod 重启次数kube_pod_container_status_restarts_total
  • Pod 就绪率(Ready / Desired)
  • Node 就绪状态

三、业务指标(来自应用本身)

这才是“应用是否健康”的最终判据,通常由应用埋点暴露:

  • 请求量(QPS
  • 接口响应时间(P99 等分位值)
  • 错误率

小结

资源指标回答“够不够”,状态指标回答“活着没”,业务指标回答“好不好”。三层都覆盖,监控才算“立体”。