如何监控 etcd 集群的健康状态?关键指标有哪些?
2026-08-11 01:06:54
# 监控
etcd 是 Kubernetes 的“大脑”,所有集群状态(API 对象、调度结果、配置)都存储在它里面。一旦 etcd 不健康,整个集群的控制面就会失灵。因此 etcd 的监控优先级极高。
关键监控指标
1. etcd_server_has_leader
- 含义:当前节点是否感知到一个 Leader;
- 健康值必须为 1。如果变成 0,说明发生了 Leader 选举失败或脑裂,集群写入会受影响。
2. etcd_disk_wal_fsync_duration_seconds
- 含义:WAL(写前日志)刷盘的延迟;
- 高延迟会直接导致集群不稳定。etcd 对磁盘 I/O 极其敏感,这条指标一旦升高要立刻排查磁盘。
3. etcd_server_proposals_failed_total
- 含义:提案(proposal)失败的总数;
- 它直接反映集群的可用性。持续增长往往意味着 Leader 不稳定或磁盘跟不上。
小结
盯住 has_leader(必须是 1)、WAL fsync 延迟(要低)、proposals_failed(要平),基本就能守住 etcd 这条生命线。