【存储工程】存储事故复盘:经典生产故障的根因与教训
深度复盘 GitLab 2017 数据库事故和 GitHub 2018 存储故障的完整时间线与根因分析,提取跨事故的通用模式,给出构建抗事故存储实践的工程建议。
发布来自土法炼钢兴趣小组的知识、笔记、进展和应用。主题包括数据结构和算法、编程语言、网络安全、密码学等。
共 2 篇文章 · 返回首页
深度复盘 GitLab 2017 数据库事故和 GitHub 2018 存储故障的完整时间线与根因分析,提取跨事故的通用模式,给出构建抗事故存储实践的工程建议。
凌晨三点的告警响了,你打开笔记本,盯着一堆指标不知道从哪里下手——两小时后发现是配置改错了。这种经历几乎每个 oncall 工程师都有过。本文从 Incident Command System 在 SRE 中的适配讲起,拆解从告警到根因的系统化排查路径,覆盖事件分级、假设驱动调试、事后复盘的无责文化、Google 与 Meta 的 oncall 体系,给出可落地的 Runbook 模板和 Postmortem 模板。