陈学俭
Home
Archives
Categories
Tags
About
2026
07-28
使用docker manifest构建镜像
07-19
x86 GPU 的机器报错处理
07-19
linux 进入单用户重置密码
07-19
如何查看Linux网卡出口流量
05-11
KubeEdge 常见故障排查(离线 / 消息积压 / 版本兼容 / 调度 / 设备)
01-20
KubeEdge 云边网络与 EdgeMesh 服务互通
2025
12-12
K8s 集群升级后 API 废弃导致资源无法更新的排查与处理
10-22
在应用发布(滚动更新)期间,如何通过监控确保发布成功?
09-17
PostgreSQL 备份恢复与版本升级(pg_dump / pg_basebackup / pg_upgrade)
09-15
KubeEdge 边缘应用编排与设备管理(DeviceTwin / Mapper)
08-18
实例状态异常(卡在 Building 或 Error),配额耗尽或镜像损坏?
07-29
K8s PVC 无法绑定导致 Pod Pending 的排查与解决
06-21
如何看待 OpenStack 在 Serverless 和 K8s 时代的定位?
06-14
监控中如何处理“高基数标签”(High Cardinality)问题?
06-06
KubeEdge 边缘节点接入与认证(edgecore + token)
05-30
KubeEdge 云端核心部署(cloudcore 架构与组件)
05-14
故障排查缺乏系统化流程,导致 MTTR 过长怎么解决?
05-13
K8s CSI 驱动排障:驱动注册、Attach/Detach 异常、Multi-Attach 多挂载
04-18
K8s 滚动更新期间部分请求 502 与就绪探针配置排查
03-13
在 Kubernetes 上运行 OpenStack(如 OpenStack on K8s),带来了哪些新问题?
03-08
如何监控 etcd 集群的健康状态?关键指标有哪些?
02-09
新用户创建虚拟机失败,LDAP 同步延迟或权限不足怎么办?
02-05
K8s JVM 应用在容器中频繁 OOMKilled 但无 Java OOM 日志的排查
01-30
海光 DCU 运维(ROCm/DCU 驱动 + Device Plugin 部署与验证)
01-22
昇腾 NPU 运维(驱动 + CANN + Device Plugin 部署与验证)
2024
10-26
K8s 单个 Pod 拖垮整个集群的雪崩效应排查与防御
10-25
运维自动化工具落地推进困难,如何破局?
10-05
国产 OS 部署 K8s 差异(Kylin / UOS / Ubuntu):依赖、内核与安全策略
09-08
监控 OpenStack 时,Ceilometer、Monasca 和 Prometheus 该如何选择?
09-07
K8s Master 节点磁盘空间不足导致磁盘使用率过高的排查与长效治理
08-19
监控系统自身如何保证高可用?Prometheus 本身是单点怎么办?
07-22
虚拟机网络不通,安全组规则或 OVS 流表异常如何排查?
06-30
K8s 高可用集群 etcd 单节点宕机的应急恢复与重建
06-12
PostgreSQL 连接与锁问题排查(pg_stat_activity / 死锁 / 连接池)
06-12
模型服务暴露与网关负载均衡及并发调优(Ingress/Gateway API)
05-27
在 K8s 中部署 Rook-Ceph 分布式存储与常见运维(OSD down、存储池)
05-19
如何有效地监控 OpenStack?有哪些成熟的工具链?
04-11
Grafana 仪表盘中,变量(Variables)如 $namespace 是如何工作的?
03-11
K8s 自定义调度器导致 Pod 调度失效排查
03-07
服务器网络无法访问,安全组或防火墙配置错误如何排查?
02-25
K8s 集群升级与备份恢复(kubeadm upgrade + etcd 快照 + Velero)
02-18
LLM 平台监控告警(DCGM-exporter + Prometheus + Grafana GPU 指标)
02-14
Overcloud 部署失败,如何分三层定位问题?
01-30
OpenStack 的高可用(HA)是如何实现的?
01-25
如何为 Prometheus 配置 ServiceMonitor 来动态发现和采集新服务的指标?
2023
12-01
K8s 服务间歇性 503 与 conntrack 表溢出排查
11-30
Prometheus 告警不生效或误报过多,如何优化?
11-18
大模型训练平台架构(Volcano 调度 + Kubeflow Operator 分布式训练)
11-10
大模型推理平台架构设计(vLLM + 分层架构 + 弹性扩缩)
10-04
PostgreSQL 主从流复制搭建与故障处理(WAL / 延迟 / 脑裂)
09-19
文件系统损坏导致数据访问异常,如何处理?
08-14
K8s etcd 磁盘 I/O 延迟高导致集群死亡螺旋排查
07-28
算力调度与 GPU 资源配额(Extended Resource + 调度 + 碎片治理)
07-26
部署 Overcloud(生产云)失败,如何分层排查?
07-22
大规模集群下,Prometheus 单点性能出现瓶颈,有哪些扩展方案?
07-20
GPU 节点环境适配:NVIDIA 驱动 + Container Toolkit + Device Plugin
06-08
虚拟机创建失败,提示 No valid host was found(三层排查)
05-27
K8s etcd 数据库碎片化导致集群脑裂崩溃排查
05-21
PostgreSQL 慢查询与执行计划分析(EXPLAIN / pg_stat_statements)
04-19
K8s 存储在线扩容:PVC 扩容后文件系统未扩展 / 只读文件系统排查
04-03
系统更新失败,回滚后服务异常如何处理?
03-22
K8s 网络插件选型与 Calico/Cilium 部署(CNI 对比)
03-16
容器 OOMKilled 问题频发,如何通过监控进行预防和快速定位?
03-15
K8s 高可用集群部署(kubeadm + HAProxy + Keepalived 堆叠 etcd)
02-19
K8s 镜像拉取失败 ImagePullBackOff 排查
02-15
OpenStack 控制节点故障时,API 服务为何长时间不可用(RabbitMQ 问题)?
2022
12-15
内存泄漏导致服务器内存持续增长,如何排查修复?
11-04
如何处理“配额限制”(Quota)导致的实例启动失败?
11-03
K8s 节点 Node 变成 NotReady 排查
10-27
如何利用 Prometheus 监控 Kubernetes Events?它有什么价值?
08-11
如何将 OpenStack 与 Ceph 分布式存储集成?
07-22
K8s Service 无法访问与集群网络不通排查
07-09
PostgreSQL 常用命令速查(psql / 库表 / 用户 / 备份)
05-09
监控 K8s 集群,必须关注的“黄金指标”有哪些?它们分别来自哪里?
04-27
应用服务进程莫名崩溃,日志无明确报错怎么查?
04-08
K8s Pod 频繁 CrashLoopBackOff 排查
03-23
虚拟机网络不通,如何系统性排查?
03-08
StatefulSet 持久化存储实战:PVC 生命周期、删除 Pod 不丢数据、PVC 不自动释放
02-18
MySQL 备份与恢复实战(mysqldump / XtraBackup / 误删恢复)
02-14
Prometheus 采集目标(Target)状态是 UP,但容器指标(如内存)就是没有数据?
01-15
K8s Pod 一直处于 Pending 状态排查(调度失败)
2021
11-09
网络带宽不足导致业务高峰期卡顿,如何排查应对?
09-17
Cinder 卷创建间歇性失败(由超配比导致)如何解?
08-30
MySQL 连接数打满(Too many connections)排查与根治
06-18
Grafana 面板显示 “No Data”,但 Pod 状态是 Running,该如何排查?
05-12
为什么说 OpenStack 部署很复杂?如何简化?
04-22
K8s 容器 Volume 挂载失败 / 挂载超时(MountVolume.SetUp 失败)排查
04-09
大规模集群下 Nova 调度性能出现瓶颈,如何优化?
03-15
MySQL 主从复制搭建与常见故障排查(延迟 / 断同步 / 报错)
02-22
磁盘空间频繁告警,日志文件增长失控怎么办?
01-28
如何有效的修改Linux云服务器的hosts配置
01-26
hexo中图片无法加载
01-20
Pod 处于 CrashLoopBackOff 状态,监控上如何快速定位根因?
2020
11-22
MySQL 慢查询排查与优化(慢日志 / EXPLAIN / 索引)
10-28
虚拟机热迁移(Live Migration)失败或性能下降,根因与调优?
09-05
Kubernetes 可观测性的“三大支柱”是什么?Prometheus 主要负责哪一块?
06-30
Keystone 支持哪些身份认证方式?
06-13
K8s StorageClass 动态供给(Dynamic Provisioning)失败排查
05-14
虚拟机创建失败,提示“No valid host was found”如何系统性排查?
04-22
SLUB:Unable to Allocate Memory
04-21
重启服务器导致docker中redis无法启动的问题解决
04-16
使用etcd快照恢复集群数据
04-16
理解和配置Out of Memory: Kill Process
04-10
MySQL 常用命令速查(连接、库表、用户、备份恢复)
04-03
Captain 运维手册
04-03
Helm常用命令手册
04-03
K8s环境使用老IP添加一个新的master节点
04-03
k8s1.13证书升级(包含etcd证书)
04-03
overlay2 use xfs filesystem cause system hang
04-03
升级docker1.12.6到18.09,并切换存储direct-lvm到overlay2
03-12
为什么说 Prometheus + Grafana 是 K8s 监控的“事实标准”?它的核心架构是怎样的?
2019
08-29
Etcd集群运维
07-09
Linux 安装腾讯 COS FTP SERVER
06-27
鼠须管五笔输入法安装配置
05-09
Helm安装使用
05-08
K8s部署kong之docker
05-08
K8s部署kong之yaml
05-07
kafka入门教程
05-05
Kubernetes之pod调度
03-21
K8s默认的services ip不通
03-21
灵雀云K8s集群对接Prometheus
03-20
Linux 性能监控工具
03-20
深入 Nginx 之架构篇
03-20
深入 Nginx 之配置篇
03-18
某云ace 2.3平台部署
03-14
使用Harbor管理Docker镜像
03-13
ES集群节点维护
03-08
AWS常用cli命令
03-08
Kubernetes的Kube Proxy的转发规则分析
03-07
使用 CLI 创建 Azure VM 的自定义映像
03-07
发布Azure资源管理(ARM)模板
03-01
Kubernetes 滚动升级
02-27
K8S的 QoS策略
02-27
K8s容器一直重启问题排查
02-27
Kubernetes Eviction Manager工作机制分析
02-27
Kubernetes的使用技巧
02-26
Hung_task_timeout_secs参数
02-26
K8S的pod内获取变量的值错误
02-26
K8s的一次路由故障
02-25
DNS介绍
02-25
Linux:配置iptables使内网虚拟机访问公网
02-24
Ansible常用模块详解
02-24
Commonly used Git command list
02-24
Git common commands
02-24
明朝皇帝列表
02-23
GitHub + Hugo to Build a Personal Blog
02-22
Create_lvm
02-22
Delete private registry mirror
02-21
Journalctl执行报错
02-20
K8s pod内访问svc IP服务不通
2018
03-09
Linux 下各文件夹的结构说明及用途介绍
02-28
故障处理的惯用思路
02-28
曾国藩:一勤天下无难事
02-25
LVS负载均衡
02-25
Pwgen随机生成密码
02-24
SELinux状态
02-24
Puppet基本流程
02-23
Use the CLI to Create Azure VM Image
02-22
nf_conntrack: table full, dropping packet