Skip to content
5 个序列 / 21 篇文章
生产排障专题数据与基础设施排障专题生产问题 · 5 个序列 · 21 篇文章把数据库连接打满、Nginx 502 和磁盘打满这类数据链路与基础设施故障集中归档。
所属领域生产问题
专题内序列5 个
专题文章21 篇
高频标签
案例排障 · 21线上排障 · 16Kafka · 4Kubernetes · 4MySQL · 4并发 · 2ClickHouse · 2Elasticsearch · 2

数据与基础设施排障专题

这里不是新的原理专题,而是故障入口页。适合先按症状定位,再回到 MySQL、Redis、MQ、检索和服务器等专题做系统补强。

起步入口4 组
专题序列5 个
关联文章21 篇
起步入口先选入口
起步入口先查数据库连接与资源耗尽适合业务大量报连接异常、连接池被打满或数据库资源明显吃紧时先进入。
起步入口先查 Nginx 和上游服务链路适合站点出现 502、上游不可用、请求无法穿透到应用时优先进入。
起步入口先查缓存、消息和检索链路适合接口抖动已经扩散到 Redis、MQ、ES、ClickHouse 这类中间件时优先进入。
起步入口先查机器空间和基础资源适合已经报警、日志写不进去、文件落盘失败,或者 Kubernetes / 节点资源异常时先进入。
阅读路径按场景进入
入门打底先建立基础设施故障的排查顺序适合先把数据库连接、网关异常、缓存热点、消息积压和磁盘空间这几类高频故障的基本排查路径补顺。
核心原理把资源状态、配置问题和链路瓶颈联系起来适合理解为什么一个表面的连接报错、热点抖动或查询超时,背后可能是容量、配置、依赖链路或资源耗尽问题。
工程实战围绕真实链路回到专题做补强适合先从线上现象切入,随后回到存储、中间件、服务器和网关专题把长期治理动作补齐的人。
案例排障和应用层故障联合排查适合先从数据库、缓存、消息、网关和磁盘层切入,随后发现问题和线程池、RT 抖动、GC 等应用现象交织在一起的人。
专题序列数据与基础设施排障专题本专题共 5 个序列 / 21 篇文章扩容后的文章会继续按序列归档在这里,适合先选一条主线再往下读。
4 篇文章数据库与网关故障排查适合把数据库连接、死锁、网关异常和磁盘空间问题放在一条排障线上看。起步文章:MySQL 连接数打满时怎么排查
  • MySQL 连接数打满时怎么排查
  • 数据库死锁和锁等待超时案例怎么复盘
  • Nginx 502 怎么排查
5 篇文章缓存、消息与检索故障排查适合把 Redis 热点、RabbitMQ 积压、Kafka lag、ES 查询变慢和 ClickHouse 超时放在同一条数据链路里排查。起步文章:Redis 热 Key 突增时怎么止血和回查
  • Redis 热 Key 突增时怎么止血和回查
  • RabbitMQ 队列积压时怎么排查
  • Kafka 积压突然飙升时怎么排查
2 篇文章容器与编排异常排查适合把 Pod Pending、CrashLoopBackOff 和节点资源异常放在容器运行环境里集中处理。起步文章:Kubernetes Pod Pending 时怎么排查
  • Kubernetes Pod Pending 时怎么排查
  • Kubernetes CrashLoopBackOff 时怎么排查
4 篇文章基础设施与中间件故障案例适合把 K8s、RabbitMQ 和数据库锁等待问题放在一条故障治理主线上看。起步文章:Kubernetes Pod Pending 时怎么排查
  • Kubernetes Pod Pending 时怎么排查
  • Kubernetes CrashLoopBackOff 时怎么排查
  • RabbitMQ 队列积压时怎么排查
6 篇文章数据与基础设施故障的分层排查适合把 Redis 抖动、MySQL 连接打满、MQ 积压、ES 发黄、ClickHouse 合并堆积和磁盘打满放在同一条基础设施排障主线上看。起步文章:Redis RT 抖动时先看命令还是网络
  • Redis RT 抖动时先看命令还是网络
  • MySQL 连接打满时要先判断哪几类来源
  • MQ 积压排查为什么先看生产端不一定对
延伸相关入口如果你已经确认故障更偏应用层,例如 GC、CPU 或线程池问题,继续到应用运行时排障专题会更高效;如果你想系统补存储、缓存、消息和检索原理,回到数据与中间件总览会更合适。
专题序列数据与基础设施排障专题本专题共 5 个序列 / 21 篇文章先选一个序列进入,再沿着左侧目录继续往下读。
序列 1 / 4 篇数据库与网关故障排查适合把数据库连接、死锁、网关异常和磁盘空间问题放在一条排障线上看。起步文章:MySQL 连接数打满时怎么排查
  • MySQL 连接数打满时怎么排查
  • 数据库死锁和锁等待超时案例怎么复盘
  • Nginx 502 怎么排查
序列 2 / 5 篇缓存、消息与检索故障排查适合把 Redis 热点、RabbitMQ 积压、Kafka lag、ES 查询变慢和 ClickHouse 超时放在同一条数据链路里排查。起步文章:Redis 热 Key 突增时怎么止血和回查
  • Redis 热 Key 突增时怎么止血和回查
  • RabbitMQ 队列积压时怎么排查
  • Kafka 积压突然飙升时怎么排查
序列 3 / 2 篇容器与编排异常排查适合把 Pod Pending、CrashLoopBackOff 和节点资源异常放在容器运行环境里集中处理。起步文章:Kubernetes Pod Pending 时怎么排查
  • Kubernetes Pod Pending 时怎么排查
  • Kubernetes CrashLoopBackOff 时怎么排查
序列 4 / 4 篇基础设施与中间件故障案例适合把 K8s、RabbitMQ 和数据库锁等待问题放在一条故障治理主线上看。起步文章:Kubernetes Pod Pending 时怎么排查
  • Kubernetes Pod Pending 时怎么排查
  • Kubernetes CrashLoopBackOff 时怎么排查
  • RabbitMQ 队列积压时怎么排查
序列 5 / 6 篇数据与基础设施故障的分层排查适合把 Redis 抖动、MySQL 连接打满、MQ 积压、ES 发黄、ClickHouse 合并堆积和磁盘打满放在同一条基础设施排障主线上看。起步文章:Redis RT 抖动时先看命令还是网络
  • Redis RT 抖动时先看命令还是网络
  • MySQL 连接打满时要先判断哪几类来源
  • MQ 积压排查为什么先看生产端不一定对

把零散经验整理成可查、可复用、可持续更新的企业级知识门户