如何监控 etcd 集群的健康状态?关键指标有哪些?
2026-08-11 01:06:54 # 监控

etcd 是 Kubernetes 的“大脑”,所有集群状态(API 对象、调度结果、配置)都存储在它里面。一旦 etcd 不健康,整个集群的控制面就会失灵。因此 etcd 的监控优先级极高。

关键监控指标

1. etcd_server_has_leader

  • 含义:当前节点是否感知到一个 Leader;
  • 健康值必须为 1。如果变成 0,说明发生了 Leader 选举失败或脑裂,集群写入会受影响。

2. etcd_disk_wal_fsync_duration_seconds

  • 含义:WAL(写前日志)刷盘的延迟;
  • 高延迟会直接导致集群不稳定。etcd 对磁盘 I/O 极其敏感,这条指标一旦升高要立刻排查磁盘。

3. etcd_server_proposals_failed_total

  • 含义:提案(proposal)失败的总数;
  • 它直接反映集群的可用性。持续增长往往意味着 Leader 不稳定或磁盘跟不上。

小结

盯住 has_leader(必须是 1)、WAL fsync 延迟(要低)、proposals_failed(要平),基本就能守住 etcd 这条生命线。