【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)
自回归推理里,历史 token 的 K/V 因果掩码下不变、可以缓存,Q 不行——本文给出可自证的归纳证明,推导显存公式与长上下文并发上限,拆解 MQA/GQA/MLA、PagedAttention、cache 量化三条正交压缩路线各解决哪一项,并给出结构性压缩路线上一处工业选择分歧与两个开放问题。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 6 篇文章 · 返回首页
自回归推理里,历史 token 的 K/V 因果掩码下不变、可以缓存,Q 不行——本文给出可自证的归纳证明,推导显存公式与长上下文并发上限,拆解 MQA/GQA/MLA、PagedAttention、cache 量化三条正交压缩路线各解决哪一项,并给出结构性压缩路线上一处工业选择分歧与两个开放问题。
KV Cache 后 decode 仍是显存带宽受限的串行循环。本文给出投机解码的接受-拒绝公式与正确性证明,推导接受率如何决定加速比,用实测数据说明批大小何时让投机解码倒贴,并只钉住 Medusa/EAGLE/MTP 的原理差异。
面向中国工程团队的大模型基础设施系列。从 GPU/CUDA/互联、训练框架与 3D 并行、vLLM/SGLang 推理引擎、量化与推测解码、RAG/Agent 到服务化、网关、可观测性与安全合规,覆盖 LLMOps 全链路。
面向工程师的大模型基础设施开篇地图,覆盖 2022 到 2026 的工程分水岭、五层工程栈、训练与推理的工程差异、中国与全球行业版图以及成本曲线。
从 Prefill/Decode 两阶段、KV Cache、Continuous Batching 到 PD 分离,系统讲清楚大模型推理的工程基础。
DeepSeek-V4 发布后,如果国产芯片已经支撑旗舰模型的关键训练或推理链路,它会怎样影响 NVIDIA 生态、国产 AI 芯片、云厂商、模型团队和工程师的技术选择?