post-transformer 标签归档

共 2 篇文章 · 返回首页

【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

线性注意力把 softmax attention 改写成可累积的矩阵状态,RWKV 让训练走 Transformer 的路、推理走 RNN 的路,RetNet 用 retention 统一 parallel/recurrent/chunkwise 三种计算。本文用 MQAR、Based、GLA、RULER 等论文的实测数据说明它们各自在哪里赢、在哪里输给 full attention。

【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化

后 Transformer 时代的判断不该是「哪个架构赢」,而是系统边界问题。本文用 Jamba、Griffin、NVIDIA 的受控对照实验说明纯 SSM 为何缺 in-context learning、混合架构为何更可能,用 RETRO/RAG/ReAct/MemGPT 说明模型与系统边界如何模糊,并结合 Hardware Lottery 与 SWE-bench/GAIA 等交互式评测讨论硬件和评测如何反向塑造架构。