architecture 标签归档

共 11 篇文章 · 返回首页

【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化

后 Transformer 时代的判断不该是「哪个架构赢」,而是系统边界问题。本文用 Jamba、Griffin、NVIDIA 的受控对照实验说明纯 SSM 为何缺 in-context learning、混合架构为何更可能,用 RETRO/RAG/ReAct/MemGPT 说明模型与系统边界如何模糊,并结合 Hardware Lottery 与 SWE-bench/GAIA 等交互式评测讨论硬件和评测如何反向塑造架构。

【系统架构设计】AI 原生架构:LLM 时代的系统设计

当 LLM 从离线批处理变成在线运行时组件,超时预算、按 token 计费、非确定性输出与多轮 Agent 编排必须进入架构的一等公民。本文从依赖语义差异出发,衔接弹性与过载保护,讨论网关成本治理、结构化输出与人审闸门、checkpoint 恢复与隐私友好的可观测,并划定与 RAG、向量引擎及训练基础设施的分工边界。

【量化交易】量化交易系统架构:研究、回测、模拟、实盘四套环境

量化策略从 notebook 走到实盘要穿过研究、回测、模拟、实盘四套环境,各写一份代码会在上线第一周从接缝处翻车。本文给出接口驱动的统一架构:用六层抽象(数据、特征、信号、组合、订单、风控)让同一份 Strategy 代码靠依赖注入在四套环境间切换,并落地 PIT 数据、订单状态机、对账、事前风控与灰度发布。

【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈

Transformer 的成功没有消除它的结构性代价。本文区分工程瓶颈和架构瓶颈,解释 O(n²) attention、KV Cache 线性增长、自回归串行性、长上下文与长期记忆的差异、位置外推和数据效率问题,并说明为什么 Mamba、RWKV、RetNet、线性注意力等路线都在试图绕开同一组限制。

【Transformer 与注意力机制】22|Encoder 详解:6 层堆叠到底在做什么

把 Transformer encoder 从“左半边”这个模糊概念拆成可操作的结构:单层里 self-attention、FFN、残差、LayerNorm 各做什么;6 层堆叠为什么不是重复劳动;encoder 输出为什么适合理解任务而不直接擅长生成;以及它和 decoder-only、encoder-decoder 两条路线到底差在哪。