从这里开始

第一次访问时先按主题切入,比直接沿着时间线翻文章更快。

热门专题

把已经形成系列阅读闭环的主题集中在首页,减少在 400 多篇文章里盲找的成本。

最新文章

按最近更新时间排序;如果你想系统性阅读一个主题,优先回到上面的专题入口。

【Transformer 与注意力机制】42|FlashAttention:注意力计算的硬件级重写

FlashAttention 的关键不是近似注意力,也不是把公式改掉,而是重新安排标准 attention 在 GPU 内存层级里的计算路径。本文解释为什么标准 attention 的瓶颈常常是 HBM 读写,FlashAttention 如何用 tiling 和 online softmax 避免物化完整注意力矩阵,以及它为什么省显存、提吞吐,却没有消除 O(n²) 的根本复杂度。

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

自回归推理和训练不是同一种程序。本文解释 KV Cache 为什么成立:历史 token 的 Key/Value 一旦算出,在后续 decode 中不会改变;缓存它们可以避免反复重算前缀。文章同时讲清 prefill 与 decode 的差异、cache 显存公式、长上下文为什么受限,以及 PagedAttention、MQA/GQA、cache 量化等方向各自在解决什么。

【Transformer 与注意力机制】51|量化、蒸馏、剪枝:压缩改变的是三种不同的东西

量化、蒸馏、剪枝常被当成同一件事的三种手段——"让模型变小",但它们改变的对象、误差来源和失败模式完全不同。本文从 weight-only 与 activation quantization 的假设差异、GPTQ/AWQ/SmoothQuant 的数学分野,讲到 attention、FFN、KV Cache 承受压缩代价的不同,以及 PPL 为什么骗过了很多人的质量评测。

【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗

attention 权重容易被读成“模型关注了哪里”,但 Jain 和 Wallace(NAACL 2019)等工作证明相关不等于因果。本文区分用户、行为、机制三层解释,梳理 attention is not explanation 之争,梯度、遮挡、探针、因果中介分析各自的证据边界,以及 RLHF 之后 LLM 自我解释为何更容易“听起来合理却不真实”。

【Transformer 与注意力机制】39|T5:把所有 NLP 任务塞进 Text-to-Text,代价在哪里

T5 把翻译、分类、摘要、问答都改写成统一的文本到文本任务,但这个接口不是免费的。本文拆开 span corruption 的 corruption rate 和平均 span 长度旋钮、T5 论文的原始消融数字、任务前缀如何变成模型的格式捷径、C4 清洗规则本身携带的归纳偏置,以及 Encoder-Decoder 在推理服务上的结构性代价,并给出 Text-to-Text 是否该覆盖分类与检索这条至今没有定论的争论线。

【Transformer 与注意力机制】40|三大路线之争:为什么大模型几乎都是 Decoder-only

Encoder-only、Encoder-Decoder、Decoder-only 的差异不是谁更聪明,而是谁能看见谁的信息流不变量。本文从可见性图出发,解释这个不变量如何锁死任务接口与训练管线,KV Cache、continuous batching、投机解码为什么默认假设单流 causal Decoder,以及 embedding、rerank、强制双向抽取场景为什么不该硬上生成式大模型。

【Transformer 与注意力机制】41|位置编码演进:从 Sinusoidal 到 RoPE、ALiBi 与长度外推的边界

RoPE 把位置从"加在输入上的向量"焊进了 Q·Kᵀ 本身——本文推导旋转后点积为何只依赖相对位置,核对高频通道在长距离上的绕圈失真、RoPE scaling/YaRN 到底改了哪个假设;再看 ALiBi 的线性 bias 何时帮、何时伤长程依赖;最后用 RULER、Lost in the Middle 说明"跑得动"和"用得好"是两件事,并摆出一条有文献支撑的争论:相对位置编码是否在用归纳偏置换长度。

【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径

MoE 把参数量和每 token 计算量解耦,但代价从模型结构转移到了路由:过载丢 token、专家塌缩、路由抖动是训练现场的三种症状,All-to-All 通信是成本中心,小 batch 推理会让专家利用率变差。本文交代这些机制为什么会发生,以及负载均衡与质量的权衡为什么还没有定量答案。

【Transformer 与注意力机制】45|ViT:patch size 和分辨率如何锁死序列长度,归纳偏置去哪了

ViT 把图像切成 patch 再当 token,但 patch size 和分辨率一旦定下来,序列长度、attention 的显存和算力也同时被锁死——这不是"像素当 token"这句简化说法能盖过去的代价。本文用 Swin 的复杂度公式和可复算的数字拆开这条代价链,解释 CNN 归纳偏置为何让它在小数据上更稳、DeiT 靠数据增强和蒸馏补的是哪一块、CLS token 与位置编码在图像分辨率变化时会怎样失效,以及"还需不需要强视觉偏置"这条至今没有定论的争论。