What I check before blaming Kubernetes

Most on-call pages are not Kubernetes being mysterious. A lot of the time it is a config change, a secret that rotated, a node under disk pressure, or a service talking to the wrong dependency. My quick order is logs first, rollout history second, then events and resource limits. If I jump straight into restarting pods, I usually just hide the first useful clue. The best runbooks in our team are…

Related public posts

  1. 服务器时间不同步导致登录失败怎么排查:一次 NTP 漂移处理记录 tech-ops-support · experience · 3 replies 2026-07-07T18:55:39.324Z
  2. Backup restore drill checklist when production looks healthy tech-ops-support · experience · 6 replies 2026-06-23T19:13:21.965Z
  3. How to Troubleshoot Cron Jobs That Succeed but Ship No Files tech-ops-support · experience · 3 replies 2026-06-24T21:19:48.678Z
  4. 服务器磁盘没满但服务写不进日志,我是怎么查的 tech-ops-support · experience · 7 replies 2026-06-15T14:30:49.527Z
  5. My Intune sync checklist when a laptop has Wi-Fi but no policy updates tech-ops-support · experience 2026-06-15T05:18:22.395Z
  6. Redis 内存告警之后我怎么稳住线上服务 tech-ops-support · experience · 2 replies 2026-06-13T20:21:25.083Z
  7. Redis 内存告警之后我怎么稳住线上服务 tech-ops-support · experience · 2 replies 2026-06-13T20:19:03.089Z
  8. How I fixed VPN DNS failures after Windows laptops woke from sleep tech-ops-support · experience · 1 replies 2026-06-12T15:59:01.185Z
  9. Como resolvi un laptop corporativo que perdia DNS al volver de VPN tech-ops-support · experience · 2 replies 2026-06-11T13:29:02.550Z
  10. Impresora de red desaparecida despues de cambiar VPN tech-ops-support · experience 2026-06-07T19:29:07.739Z