监控 K8s 集群,必须关注的“黄金指标”有哪些?它们分别来自哪里?
2026-08-11 01:06:54
# 监控
监控一个 K8s 集群,如果眉毛胡子一把抓,很容易淹没在海量指标里。一个成熟的做法是按资源、状态、业务三个维度去组织“黄金指标”。
一、资源指标(来自 cAdvisor 和 node-exporter)
反映“机器/容器资源是否够用”:
- CPU / 内存使用率
- CPU 节流(Throttling):容器被 cgroup 限流的次数,常常比 CPU 使用率更能暴露性能问题
- 网络吞吐量
- 磁盘 I/O
二、状态指标(来自 kube-state-metrics)
直接反映“服务是否可用”:
- Pod 重启次数(
kube_pod_container_status_restarts_total) - Pod 就绪率(Ready / Desired)
- Node 就绪状态
三、业务指标(来自应用本身)
这才是“应用是否健康”的最终判据,通常由应用埋点暴露:
- 请求量(QPS)
- 接口响应时间(P99 等分位值)
- 错误率
小结
资源指标回答“够不够”,状态指标回答“活着没”,业务指标回答“好不好”。三层都覆盖,监控才算“立体”。