linear-attention 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

线性注意力把 softmax attention 改写成可累积的矩阵状态,RWKV 让训练走 Transformer 的路、推理走 RNN 的路,RetNet 用 retention 统一 parallel/recurrent/chunkwise 三种计算。本文用 MQAR、Based、GLA、RULER 等论文的实测数据说明它们各自在哪里赢、在哪里输给 full attention。