load-balancing 标签归档

共 15 篇文章 · 返回首页

【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径

MoE 把参数量和每 token 计算量解耦,但代价从模型结构转移到了路由:过载丢 token、专家塌缩、路由抖动是训练现场的三种症状,All-to-All 通信是成本中心,小 batch 推理会让专家利用率变差。本文交代这些机制为什么会发生,以及负载均衡与质量的权衡为什么还没有定量答案。