【Transformer 与注意力机制】50|Speculative Decoding:用小模型加速大模型
KV Cache 后 decode 仍是显存带宽受限的串行循环。本文给出投机解码的接受-拒绝公式与正确性证明,推导接受率如何决定加速比,用实测数据说明批大小何时让投机解码倒贴,并只钉住 Medusa/EAGLE/MTP 的原理差异。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 2 篇文章 · 返回首页
KV Cache 后 decode 仍是显存带宽受限的串行循环。本文给出投机解码的接受-拒绝公式与正确性证明,推导接受率如何决定加速比,用实测数据说明批大小何时让投机解码倒贴,并只钉住 Medusa/EAGLE/MTP 的原理差异。
Encoder-only、Encoder-Decoder、Decoder-only 的差异不是谁更聪明,而是谁能看见谁的信息流不变量。本文从可见性图出发,解释这个不变量如何锁死任务接口与训练管线,KV Cache、continuous batching、投机解码为什么默认假设单流 causal Decoder,以及 embedding、rerank、强制双向抽取场景为什么不该硬上生成式大模型。