【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径
MoE 把参数量和每 token 计算量解耦,但代价从模型结构转移到了路由:过载丢 token、专家塌缩、路由抖动是训练现场的三种症状,All-to-All 通信是成本中心,小 batch 推理会让专家利用率变差。本文交代这些机制为什么会发生,以及负载均衡与质量的权衡为什么还没有定量答案。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
MoE 把参数量和每 token 计算量解耦,但代价从模型结构转移到了路由:过载丢 token、专家塌缩、路由抖动是训练现场的三种症状,All-to-All 通信是成本中心,小 batch 推理会让专家利用率变差。本文交代这些机制为什么会发生,以及负载均衡与质量的权衡为什么还没有定量答案。