kv-cache-quantization 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

自回归推理里,历史 token 的 K/V 因果掩码下不变、可以缓存,Q 不行——本文给出可自证的归纳证明,推导显存公式与长上下文并发上限,拆解 MQA/GQA/MLA、PagedAttention、cache 量化三条正交压缩路线各解决哪一项,并给出结构性压缩路线上一处工业选择分歧与两个开放问题。