【系统架构设计】优雅降级:如何体面地\"坏掉\"
系统过载时,被动失效和主动降级看起来结果相似,工程含义却完全不同。本文从 Google SRE 的负载脱落与优雅降级实践出发,给出可执行的降级目录、触发信号、开关编排与恢复顺序,讨论一致性边界、用户提示与常见反模式,并说明它如何与熔断、限流协同工作。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
系统过载时,被动失效和主动降级看起来结果相似,工程含义却完全不同。本文从 Google SRE 的负载脱落与优雅降级实践出发,给出可执行的降级目录、触发信号、开关编排与恢复顺序,讨论一致性边界、用户提示与常见反模式,并说明它如何与熔断、限流协同工作。
SLI、SLO、SLA 不只是运维指标——它们是架构决策的定量依据。本文从 Google SRE 的 Error Budget 策略出发,拆解多窗口燃烧率告警的数学原理,讲清楚 SLO 如何在产品与工程的冲突中充当仲裁者,并给出基于 Prometheus 和 Grafana 的落地方案。
SLO 不是定几个 99.9% 的数字,而是连接业务需求与工程决策的治理机制。从 SLI 定义、错误预算计算到 Google SRE 多窗口多燃烧率 PromQL 规则,并说明 DB 层 SLI 如何映射到服务 SLO。