【Transformer 与注意力机制】43|稀疏与局部注意力:Longformer、BigBird、Sparse Transformer
FlashAttention 优化的是 full attention 这张完全图的 IO 路径,稀疏 attention 直接改写连接图本身。本文用邻接矩阵钉死 Sparse Transformer 的结构化两跳可达、Longformer 的 local+global 与自定义 kernel、BigBird 的随机图连通性证明与理论下界,并划清它与 Ring Attention、学习型 sparsity 的边界。