【Transformer 与注意力机制】50|Speculative Decoding:用小模型加速大模型
KV Cache 后 decode 仍是显存带宽受限的串行循环。本文给出投机解码的接受-拒绝公式与正确性证明,推导接受率如何决定加速比,用实测数据说明批大小何时让投机解码倒贴,并只钉住 Medusa/EAGLE/MTP 的原理差异。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
KV Cache 后 decode 仍是显存带宽受限的串行循环。本文给出投机解码的接受-拒绝公式与正确性证明,推导接受率如何决定加速比,用实测数据说明批大小何时让投机解码倒贴,并只钉住 Medusa/EAGLE/MTP 的原理差异。