long-context 标签归档

共 6 篇文章 · 返回首页

【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈

FlashAttention 能把 attention 的 I/O 推到理论下界,却动不了 FLOPs;SETH 复杂度理论进一步证明标准 attention 在多数参数区间没有亚二次算法。本文区分工程瓶颈与架构瓶颈,用 RULER、Lost in the Middle 和数据受限 scaling law 说明长上下文非长期记忆、数据效率有硬约束,并给出新架构必须同时赢下的质量/成本/稳定/生态四条战线。

【Transformer 与注意力机制】41|位置编码演进:从 Sinusoidal 到 RoPE、ALiBi 与长度外推的边界

RoPE 把位置从"加在输入上的向量"焊进了 Q·Kᵀ 本身——本文推导旋转后点积为何只依赖相对位置,核对高频通道在长距离上的绕圈失真、RoPE scaling/YaRN 到底改了哪个假设;再看 ALiBi 的线性 bias 何时帮、何时伤长程依赖;最后用 RULER、Lost in the Middle 说明"跑得动"和"用得好"是两件事,并摆出一条有文献支撑的争论:相对位置编码是否在用归纳偏置换长度。

【Transformer 与注意力机制】43|稀疏与局部注意力:Longformer、BigBird、Sparse Transformer

FlashAttention 优化的是 full attention 这张完全图的 IO 路径,稀疏 attention 直接改写连接图本身。本文用邻接矩阵钉死 Sparse Transformer 的结构化两跳可达、Longformer 的 local+global 与自定义 kernel、BigBird 的随机图连通性证明与理论下界,并划清它与 Ring Attention、学习型 sparsity 的边界。