土法炼钢兴趣小组的算法知识备份

【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径

文章导航

分类入口
transformer
标签入口
#transformer#state-space-model#mamba#s4#hippo#selective-ssm#parallel-scan#kv-cache#long-sequence

Transformer系列导航

按系列顺序继续阅读,而不是停在单篇。

系列目录上一篇:【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈下一篇:【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

目录

55|Transformer 的根本局限 讲过,full attention 的二次关系、KV Cache 的线性增长和自回归串行性共同构成长序列瓶颈。状态空间模型(State Space Model, SSM)换了一种赌法:不让每个 token 显式查表看所有历史 token,而是用一个大小固定的状态携带历史。这个赌法的代价立刻就能想到——状态是有限的,历史迟早装不下,必须决定丢什么。

S4(Gu, Goel, and Ré, ICLR 2022)证明了这个赌法在特定任务上可以赢:只要状态矩阵结构设计得足够精细,模型能记住上万步之前的信息。但 S4 长期困在长序列任务的小圈子里,因为它的状态更新对所有输入都用同一套固定规则,遇到需要按内容取舍的任务就会失败。Mamba(Gu and Dao, arXiv:2312.00752, 2023)把状态更新变成依赖输入内容的选择性机制,同时用一套并行扫描算法保住了训练时的并行度,才第一次把 SSM 推到能和 Transformer 掰手腕的语言模型规模。

本篇能让你学会三件事:

  1. 状态压缩和显式查表是两种不同的信息取舍,S4 和 Mamba 分别在这条取舍线上解决了哪个具体问题;
  2. selective SSM 为什么必须放弃卷积形式,parallel scan 又如何把这笔账挣回来,让递归依然线性且可并行训练;
  3. 推理时状态 \(O(1)\) 显存对 KV Cache \(O(n)\) 显存在什么条件下赢,在什么条件下会因为检索能力不够而输。

一、两种携带历史的方式:状态压缩 vs 显式查表

最小状态空间直觉可以写成:

\[ h_t = A h_{t-1} + B x_t, \qquad y_t = C h_t \]

输入 \(x_t\) 更新状态 \(h_t \in \mathbb{R}^N\),输出 \(y_t\) 从状态中读出。历史不以 token 列表形式保存,而被折叠进一个维度固定的向量。

Mamba 论文把这个对比说得很直接:序列建模的根本问题是把上下文压缩进一个更小的状态,而流行序列模型之间的取舍可以完全用这个视角解释——attention 之所以既有效又低效,恰恰因为它完全不压缩上下文:自回归推理必须显式保存全部历史 K/V(也就是 KV Cache),这直接导致推理线性增长、训练二次增长;循环模型(RNN、SSM)之所以高效,是因为它们的状态是有限的,推理常数时间、训练线性时间,但有效性完全取决于这个有限状态把上下文压缩得好不好1

把这句话拆成三条可核对的结论:

下图对比两种信息流:attention 是一张查表,每个 query 都能直接连到所有历史 K/V;SSM 是一条链,历史只能通过状态一步步传递。

flowchart LR
    subgraph ATT["Full attention: explicit lookup, no compression"]
    direction TB
    k1["token 1 K/V"] -.-> q["current token's query"]
    k2["token 2 K/V"] -.-> q
    k3["token 3 K/V"] -.-> q
    kn["... token n-1 K/V"] -.-> q
    end
    subgraph SSM["SSM: history folded into fixed-size state"]
    direction LR
    s0["h_0"] --> s1["h_1"]
    s1 --> s2["h_2"]
    s2 --> s3["..."]
    s3 --> sn["h_n"]
    end

这就是本篇要反复回到的一句话:S4 解决的是”状态怎样才能记得住远处的历史”,Mamba 解决的是”状态怎样才能按内容决定该记什么、忘什么”。两者是同一个信息瓶颈问题的两个不同侧面,不是同一个问题的两代方案。


二、S4:结构化状态空间——为什么能长程,为什么难训

2.1 朴素状态空间为什么记不住历史

朴素 SSM(把 \(A\) 设成随机矩阵)表现很差,直觉原因和 RNN 的梯度消失/爆炸问题(见 10|RNN 的根本局限)同源:线性一阶常微分方程的解是指数函数,序列越长,状态里累积的 \(A\) 的幂次就越可能指数级放大或缩小2。S4 的前身 LSSL 用 HiPPO 理论(Gu et al., NeurIPS 2020)解决了这个问题:HiPPO 给出一类特殊矩阵 \(A\),使状态 \(h_t\) 在数学上等价于把输入历史投影到一组正交多项式基(如 Legendre 多项式)上做在线更新,也就是让状态成为历史的一个有原则的、可控误差的压缩表示,而不是随机线性变换的自然结果3。这不是一句空话:LSSL 的实验里,仅仅把 \(A\) 从随机矩阵换成 HiPPO 矩阵,sequential MNIST 的准确率就从 60% 跳到 98%4

这一步回答了”为什么能长程”:不是 SSM 天生擅长长程依赖,而是 HiPPO 结构化的 \(A\) 让状态更新变成一个理论上稳定的历史压缩过程。

2.2 结构化到能训的地步很难

HiPPO 矩阵解决了记忆问题,却带来两个新的工程麻烦,这才是”难训”真正的来源,而不是通常意义上的优化不收敛:

S4 的贡献是绕开这两个麻烦:把 \(A\) 参数化成 Normal Plus Low-Rank(等价于复数域上的 Diagonal Plus Low-Rank,DPLR),低秩部分用 Woodbury 恒等式修正,剩下的对角部分转化成一个数值上稳定、研究得很透彻的 Cauchy 核问题7。最终复杂度降到 \(\tilde{O}(N+L)\) 时间、\(O(N+L)\) 空间,比 LSSL 快 30 倍、省 400 倍显存8。这一套技巧不是控制论教科书里的通用方法,而是专门针对 HiPPO 矩阵这一类结构设计的数值技巧——这也是为什么 S4 的实现门槛明显高于普通 attention:难的不是训练收敛,而是把一个数学上正确的模型变成一个数值上能跑起来的模型

工程回报是实打实的:S4 在 Long Range Arena 全部任务上取得当时最好成绩,解出此前所有方法都失败的 Path-X 任务(序列长度 16000);在无数据增强的 sequential CIFAR-10 上达到 91% 准确率,接近更大的 2D ResNet9

2.3 S4 的边界:LTI 是长程能力的来源,也是它的天花板

S4 的 \(A, B, C\) 一旦训练完成,在推理时对所有位置都是同一套参数——这类系统在控制论里叫线性时不变(Linear Time-Invariant, LTI)。LTI 有个好处:整个序列的输出可以等价成一次长卷积,训练时能像 CNN 一样并行、用 FFT 加速。但代价是模型没有办法”看内容做决定”:同一个位置永远用同一种方式更新状态,不管这个位置上出现的是关键实体还是无意义的填充词。S4 论文自己也承认,在语言建模上仍然落后于 Transformer10——这正是 Mamba 要解决的下一个问题。


三、Mamba:selective SSM——选择性为什么是关键的一步

3.1 LTI 到底输在哪里

Mamba 论文用两个合成任务把 LTI 的失败模式钉死11

这不是空谈,Mamba 论文给出了可核对的消融数字(Table 1,Selective Copying 任务):同一套架构下把 SSM 层从 S4(LTI)换成 S6(selective),准确率从 18.3% 跳到 97.0%;换到 Mamba 整体架构,从 56.4% 跳到 99.8%12。语言建模的困惑度消融也是同一个方向:H3 架构里把 S4 换成 S6,Pile 困惑度从 10.30–10.34 降到 8.95;Mamba 架构里从 10.54–10.56 降到 8.6913。选择性不是锦上添花的小技巧,是这一类合成任务和真实语言建模都验证过的必要条件。

3.2 选择机制具体做了什么

Mamba 的做法是让 \(\Delta, B, C\) 都变成当前输入 \(x_t\) 的函数(用小的线性投影计算,\(\Delta\) 再过一次 softplus),而不是训练完就固定的参数14\(\Delta\) 是离散化步长,直觉上像是一个门:\(\Delta\) 大意味着”重置状态、聚焦当前输入”,\(\Delta\) 小意味着”保持旧状态、忽略当前输入”,这和 RNN 里的门控机制是同一个数学结构的推广15。语言不是均匀信号,标点、填充词、关键实体对未来的重要性天差地别,选择机制让状态更新变成一种按内容决定的条件记忆管理,而不是无差别地把每个 token 都同等力度地折进状态。

这一步付出的代价也要说清楚:\(\Delta, B, C\) 随时间变化,意味着系统不再是 LTI,S4 那套”整段序列等价于一次卷积”的技巧直接失效——这就是为什么 Mamba 需要一套新的计算方法,也是下一节的主题。


四、parallel scan:递归怎样才能既线性又能并行训练

4.1 选择性带来的计算难题

一旦 \(A_t, B_t\) 依赖输入,\(h_t = A_t h_{t-1} + B_t x_t\) 就只能按 \(t\) 顺序算:朴素实现要在 GPU 上跑 \(L\) 步串行循环,这对训练并行度是灾难,尤其当 \(L\) 到几千上万时。

4.2 递归可以不按顺序算,只要满足一个条件

关键的数学观察是:把每一步的状态更新看成一个仿射变换 \((A_t, b_t)\),其中 \(b_t = B_t x_t\),定义两个仿射变换的组合:

\[ (A_2, b_2) \circ (A_1, b_1) = (A_2 A_1,\ A_2 b_1 + b_2) \]

这个组合运算满足结合律——先合并 \((A_1,b_1)\)\((A_2,b_2)\),再和 \((A_3,b_3)\) 合并,和先合并 \((A_2,b_2)\)\((A_3,b_3)\)、再和 \((A_1,b_1)\) 合并,结果相同。结合律成立意味着这个前缀计算可以用一棵平衡二叉树自底向上合并,而不必严格从左到右一步步算——这正是 work-efficient parallel scan(Blelloch, 1990;Mamba 论文同时引用了 Martin and Cundy, 2018 与 Smith, Warrington, and Linderman 2023 的相关工作)的核心思想16。合并的深度是 \(O(\log L)\),总工作量仍是 \(O(L)\),没有变成 \(O(L \log L)\) 或更差。

flowchart TB
    subgraph L0["level 0: per-step affine maps"]
    a1["(A1,b1)"]
    a2["(A2,b2)"]
    a3["(A3,b3)"]
    a4["(A4,b4)"]
    end
    subgraph L1["level 1: pairwise merge, depth 1"]
    c12["(A2A1, A2 b1+b2)"]
    c34["(A4A3, A4 b3+b4)"]
    end
    subgraph L2["level 2: merge again, depth 2"]
    c14["prefix state after 4 steps"]
    end
    a1 --> c12
    a2 --> c12
    a3 --> c34
    a4 --> c34
    c12 --> c14
    c34 --> c14

这就是”既线性又能并行训练”的答案:线性指总工作量仍是 \(O(L)\),没有退回到 attention 的 \(O(L^2)\)可并行指树形合并把串行深度从 \(O(L)\) 压到 \(O(\log L)\),可以铺在 GPU 的并行线程上。这不是免费的——选择性打破了卷积等价性,parallel scan 是为了把这笔账挣回来而设计的替代方案,不是比卷积更聪明的捷径。

4.3 工程落地:三个经典技巧,不展开成 kernel 全书

Mamba 论文把实际的 GPU 实现总结成三个技巧——kernel fusion、parallel scan、recomputation17:把离散化、扫描、读出融合进一个 kernel,中间结果留在片上高速存储(SRAM)里不写回显存(HBM);用上一节的 parallel scan 做扫描本身;反向传播不保存所有中间状态,而是重新算一遍来换显存。三者叠加的效果是官方报告的训练扫描比朴素实现快 40 倍,且这套 SSM scan 在序列长度超过 2K 后比当时最快的 FlashAttention-2 实现还快(状态维度 \(N=16\)18。具体的 CUDA kernel 排布、SRAM tile 大小这类实现细节不在本篇展开,读者需要时直接读论文 Section 3.3 和开源实现。


五、推理状态 O(1) 显存 vs KV Cache O(n):什么时候赢,什么时候输

5.1 显存对比

49|KV Cache 讲过,Transformer 的 KV Cache 大小是 \(2 \times L \times B \times S \times H_{kv} \times D_h \times \text{bytes}\),随缓存序列长度 \(S\) 线性增长。SSM 的推理状态大小固定为每层 \(O(N)\)\(N\) 是状态维度),和 \(S\) 完全无关——这是状态压缩范式在推理阶段最直接的红利:请求越长,SSM 的显存优势越明显,因为它的显存账单根本不含序列长度这一项。

5.2 何时赢:吞吐

没有随长度增长的 KV Cache,意味着同样显存下可以塞进更大的 batch。Mamba 论文在 A100 80GB、prompt 长度 2048 的条件下报告端到端推理吞吐比同尺寸 Transformer 高 4 到 5 倍19;更极端的例子是一个未训练的 Mamba-6.9B,推理吞吐仍然高于比它小 5 倍的 Transformer-1.3B,原因正是 Mamba 不需要保存历史 K/V,可以用远大得多的 batch size 吃满显存20。语言建模质量上,Mamba-3B 在常识推理评测上的平均分比同尺寸的 Pythia-3B 高 4 个百分点,甚至超过参数量两倍于自己的 Pythia-7B21。这些数字都来自论文自己的实验,尚未经过第三方大规模复现,读者引用时应视作”论文报告的结果”而不是”业界共识”。

何时会赢是清楚的:长上下文流式生成、高并发在线服务、不需要从任意远处逐字取回信息的任务——状态压缩带来的显存优势会直接转化成吞吐优势。

5.3 何时输:精确检索

固定状态显然不是免费午餐。Jelassi et al. 的工作(“Repeat After Me: Transformers are Better than State Space Models at Copying”, ICML 2024)从理论和实验两条线证明了这一点22

这和 Mamba 论文自己报告的 Selective Copying、Induction Heads 结果(selective SSM 能解到 99.8% 并外推到百万长度)并不矛盾,而是两类不同的任务:Mamba 论文里的合成任务是在训练分布内设计好的、有规律可学的模式(如需要过滤固定颜色的噪声 token);Jelassi et al. 测的是通用、任意内容的字符串复制与检索,不依赖训练时能学到的捷径。这恰恰说明选择性机制能缓解”按内容取舍”的问题,却不能突破”状态容量决定能装下多少可精确检索的信息”这条硬约束——这是本篇要点名的第一处有文献支撑的争论:SSM 的效率优势和 Transformer 的检索优势,在理论上就不是同一个维度可以简单比较的。


六、SSD 与混合架构:一句话边界

Dao and Gu 的后续工作(“Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality”, ICML 2024)证明了一件更根本的事:SSM 的线性递归形式和一种结构化掩码 attention,可以看成同一类结构化半可分(semiseparable)矩阵的两种不同分解方式——这就是论文标题里的”duality”23。基于这个对偶,SSD 算法把序列切成固定大小的块,块内用矩阵乘法(吃满张量核)、块间用线性递归,同时拿到两边的好处:比 Mamba 原始的 selective scan 快 2 到 8 倍,支持的状态维度可以做到 8 倍大而几乎不掉速度,在序列长度 16K 时比 FlashAttention-2 快 6 倍24。这套框架催生了 Mamba-2。

一句话边界:SSD 揭示 full attention 和 selective SSM 不是两个互相排斥的范式,而是同一族”结构化矩阵混合器”在稠密端和分块递归端的两个取值——这给”哪些层用 attention、哪些层用 SSM”提供了一个连续的设计谱系,而不只是工程上硬拼两种模块。

这个设计谱系已经有生产级的例子。AI21 的 Jamba(“Jamba: A Hybrid Transformer-Mamba Language Model”, 2024)按大约每 8 层放 1 层 attention、其余用 Mamba 层的比例交替堆叠,中间混入 MoE 增加容量,支持 256K 上下文并能塞进单张 80GB GPU25。它的设计意图正好对应第五节的结论:少数 attention 层负责精确检索和跨 token 的显式交互,大多数 Mamba 层负责压缩长程状态、降低显存和吞吐成本。


七、争论与开放问题:SSM 能否取代通用 LLM

争论本身:一方(Gu and Dao 及后续 SSD/Mamba-2 工作)的证据是,在同等训练算力下 selective SSM 可以达到甚至超过同尺寸 Transformer 的语言建模质量,同时推理吞吐更高、长序列显存更省,论文称 Mamba 是”第一个真正达到 Transformer 质量的线性时间序列模型”26。另一方(Jelassi et al. 及其理论结果)的证据是,固定大小状态在精确复制、检索类任务上存在数学上的容量上界,这类能力恰恰是检索增强生成、多轮工具调用、代码理解等实际场景依赖的能力,不会随着训练数据或状态维度的常规扩大而消失27。两边引用的都是可核对的论文结果,不是营销话术互相打嘴仗——这说明”SSM 能不能取代通用 LLM”目前没有单一答案,答案取决于任务是不是检索密集型。

由此可以列出两个具体的开放问题:

  1. 状态容量与检索能力的权衡曲线还没有系统刻画。Jelassi et al. 证明了固定状态存在检索上界,但”多大的状态维度、配合什么训练目标,可以让 SSM 在检索密集型任务上追平 Transformer,追平的代价是多少推理效率”仍是实证空白;读者可以从 Jelassi et al., ICML 2024 的实验设置出发继续验证。
  2. 混合架构里 attention 层与 SSM 层的最优比例缺乏理论指导。Jamba 用了大约 1:8 的经验比例,SSD 的结构对偶给出了统一的数学记号,但从对偶框架推导”给定任务分布和硬件预算,最优比例是多少”这一步还没有人做;这是 SSD 论文留下的、明确可检验的后续方向28

这两个问题都不接受”以后会统一”“AI 会解决一切”式的空洞收尾——它们分别指向可执行的实验和可推导的架构搜索,而不是等待某个模型一夜之间证明自己。


八、关键概念回顾


九、常见误解

9.1 “线性复杂度一定更强”

不成立。复杂度低只是成本优势;Jelassi et al. 的理论和实验都表明,固定状态在检索密集型任务上有独立于训练方法的容量上界,这不会因为”训练得更好”而消失。

9.2 “Mamba 就是 RNN 换名字”

不准确。传统 RNN 的参数在训练后对所有输入固定;Mamba 的 \(\Delta, B, C\) 随输入内容变化,并依赖 parallel scan 而不是严格串行的前向传播来训练,这是选择性机制和硬件友好算法共同带来的、和普通 RNN 不同的计算路径。

9.3 “SSM 已经证明能取代 Transformer”

没有。Mamba 在语言建模困惑度和部分下游任务上追平甚至超过同尺寸 Transformer,但在需要精确复制、检索上下文的任务上有文献支撑的差距。Jamba 这类生产级混合架构选择保留少量 attention 层,本身就是对”纯 SSM 还不够”的工程回应。

9.4 “KV Cache 更贵,所以 SSM 推理必然更快更好”

推理吞吐更快是有条件的:批量足够大、上下文足够长时,状态压缩的显存优势才能转化成吞吐优势;如果任务需要从长上下文里精确取回信息,更快的吞吐可能是用检索质量换来的。


十、下一步

S4 和 Mamba 展示了”状态压缩 + 选择性 + 并行扫描”这一条路径能走到哪里,以及它在检索密集型任务上明确留下的空白。下一篇 57|RWKV / RetNet / 线性注意力 横向比较另外几条压缩历史的路线:线性注意力直接改写 attention 的计算形式,RWKV 和 RetNet 从不同角度融合 RNN 推理形态与 Transformer 训练效率。把它们放在一起看,才能回答”后 Transformer 时代”到底有几条可行路线,以及它们各自在哪类任务上会输。


十一、参考文献

  1. Gu, A., Dao, T., Ermon, S., Rudra, A., and Ré, C. “HiPPO: Recurrent Memory with Optimal Polynomial Projections.” NeurIPS 2020. 长程记忆的结构化状态矩阵理论来源。
  2. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022(Outstanding Paper Award). S4 论文,DPLR 参数化、Woodbury 恒等式与 Cauchy 核、复杂度分析与 Long Range Arena 结果。
  3. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023. 预印本,未经正式同行评审;文中 Selective Copying 消融、困惑度消融、推理吞吐与训练加速数字均为论文自测结果,引用时按论文报告对待。
  4. Dao, T. and Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.” ICML 2024. SSD 框架、Mamba-2、attention 与 SSM 的结构化半可分矩阵对偶。
  5. Jelassi, S., Brandfonbrener, D., Kakade, S. M., and Malach, E. “Repeat After Me: Transformers are Better than State Space Models at Copying.” ICML 2024. 固定状态模型在复制/检索任务上的理论上界与实证差距,本篇”何时输”与”争论”部分的主要依据。
  6. Lieber, O. et al. (AI21 Labs). “Jamba: A Hybrid Transformer-Mamba Language Model.” arXiv:2403.19887, 2024. 生产级 Transformer-Mamba-MoE 混合架构的具体设计比例与效果。

← 上一篇:55|Transformer 的根本局限 | 下一篇:57|RWKV / RetNet / 线性注意力


  1. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  2. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  3. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  4. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  5. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  6. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  7. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  8. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  9. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  10. Gu, A., Goel, K., and Ré, C. “Efficiently Modeling Long Sequences with Structured State Spaces.” ICLR 2022.↩︎

  11. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  12. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  13. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  14. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  15. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  16. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  17. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  18. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  19. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  20. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  21. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  22. Jelassi, S., Brandfonbrener, D., Kakade, S. M., and Malach, E. “Repeat After Me: Transformers are Better than State Space Models at Copying.” ICML 2024.↩︎

  23. Dao, T. and Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.” ICML 2024.↩︎

  24. Dao, T. and Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.” ICML 2024.↩︎

  25. Lieber, O. et al. “Jamba: A Hybrid Transformer-Mamba Language Model.” arXiv:2403.19887, 2024.↩︎

  26. Gu, A. and Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023.↩︎

  27. Jelassi, S., Brandfonbrener, D., Kakade, S. M., and Malach, E. “Repeat After Me: Transformers are Better than State Space Models at Copying.” ICML 2024.↩︎

  28. Dao, T. and Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.” ICML 2024.↩︎

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-04-15 · transformer

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

自回归推理和训练不是同一种程序。本文解释 KV Cache 为什么成立:历史 token 的 Key/Value 一旦算出,在后续 decode 中不会改变;缓存它们可以避免反复重算前缀。文章同时讲清 prefill 与 decode 的差异、cache 显存公式、长上下文为什么受限,以及 PagedAttention、MQA/GQA、cache 量化等方向各自在解决什么。

2026-08-06 · transformer

【Transformer 与注意力机制】51|量化、蒸馏、剪枝:压缩改变的是三种不同的东西

量化、蒸馏、剪枝常被当成同一件事的三种手段——"让模型变小",但它们改变的对象、误差来源和失败模式完全不同。本文从 weight-only 与 activation quantization 的假设差异、GPTQ/AWQ/SmoothQuant 的数学分野,讲到 attention、FFN、KV Cache 承受压缩代价的不同,以及 PPL 为什么骗过了很多人的质量评测。

2026-08-06 · transformer

【Transformer 与注意力机制】40|三大路线之争:为什么大模型几乎都是 Decoder-only

Encoder-only、Encoder-Decoder、Decoder-only 的差异不是谁更聪明,而是谁能看见谁的信息流不变量。本文从可见性图出发,解释这个不变量如何锁死任务接口与训练管线,KV Cache、continuous batching、投机解码为什么默认假设单流 causal Decoder,以及 embedding、rerank、强制双向抽取场景为什么不该硬上生成式大模型。

2026-06-09 · transformer

【Transformer 与注意力机制】59|推理退化:为什么大模型会输出乱码、死循环和无意义文本

大模型推理时偶尔会突然陷入死循环、输出乱码或连续无意义数字,这不是随机 bug,而是注意力机制、Causal Mask、解码策略和数值精度在自回归生成中共同作用的结果。本文从 QKV 计算坍塌出发,解释 Attention Sink、Softmax 马太效应、Causal Mask 的退路切断、FP16 溢出路径和 KV Cache 污染,并给出从架构到运行时的多层防线。


By .