kv-cache 标签归档

共 9 篇文章 · 返回首页

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

自回归推理里,历史 token 的 K/V 因果掩码下不变、可以缓存,Q 不行——本文给出可自证的归纳证明,推导显存公式与长上下文并发上限,拆解 MQA/GQA/MLA、PagedAttention、cache 量化三条正交压缩路线各解决哪一项,并给出结构性压缩路线上一处工业选择分歧与两个开放问题。

【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈

FlashAttention 能把 attention 的 I/O 推到理论下界,却动不了 FLOPs;SETH 复杂度理论进一步证明标准 attention 在多数参数区间没有亚二次算法。本文区分工程瓶颈与架构瓶颈,用 RULER、Lost in the Middle 和数据受限 scaling law 说明长上下文非长期记忆、数据效率有硬约束,并给出新架构必须同时赢下的质量/成本/稳定/生态四条战线。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

推理退化不是单一故障。死循环、乱码/控制字符、无意义数字串各自踩中注意力正反馈、数值溢出与词表边缘的不同路径。本文分清三种形态的触发条件与可观察信号,钉住 Softmax 马太效应、Attention Sink、Causal Mask 退路切断、FP16/量化与 KV Cache 污染,并给出架构到运行时的分层防线、争论与开放问题。

【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径

Transformer 用 KV Cache 保存全部历史,SSM 用固定状态压缩历史。本文讲清 S4 为何长程却难训、Mamba 的 selective SSM 与 parallel scan 如何让递归既线性又能并行训练,比较推理状态与 KV Cache 的胜负边界,并给出 SSM 能否取代通用 LLM 的争论。

【Transformer 与注意力机制】51|量化、蒸馏、剪枝:压缩改变的是三种不同的东西

量化、蒸馏、剪枝常被当成同一件事的三种手段——"让模型变小",但它们改变的对象、误差来源和失败模式完全不同。本文从 weight-only 与 activation quantization 的假设差异、GPTQ/AWQ/SmoothQuant 的数学分野,讲到 attention、FFN、KV Cache 承受压缩代价的不同,以及 PPL 为什么骗过了很多人的质量评测。

【Transformer 与注意力机制】40|三大路线之争:为什么大模型几乎都是 Decoder-only

Encoder-only、Encoder-Decoder、Decoder-only 的差异不是谁更聪明,而是谁能看见谁的信息流不变量。本文从可见性图出发,解释这个不变量如何锁死任务接口与训练管线,KV Cache、continuous batching、投机解码为什么默认假设单流 causal Decoder,以及 embedding、rerank、强制双向抽取场景为什么不该硬上生成式大模型。

【Transformer 与注意力机制】17|Causal Mask:让模型只看过去不看未来

自回归语言模型的核心约束是:预测 t 时刻只能用 t 之前的信息。Causal Mask 用一个上三角的 -∞ 矩阵让 softmax 之后未来位置的权重恒为零,使得模型在训练时能并行计算所有时间步、推理时严格自回归。本文从 teacher forcing 到 attention sink,把 causal mask 在训练、推理、长上下文中的所有面相讲清楚。