【GPU 算子工程】通信与计算重叠:NCCL collective 与 kernel overlap
多卡训练/推理中,通信不与计算重叠就是纯开销。讲三个层次的重叠:kernel 内 cp.async 异步加载、kernel 间 stream 并发、分布式里 NCCL collective 与反向计算的重叠,以及 SM 资源争抢的代价。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
多卡训练/推理中,通信不与计算重叠就是纯开销。讲三个层次的重叠:kernel 内 cp.async 异步加载、kernel 间 stream 并发、分布式里 NCCL collective 与反向计算的重叠,以及 SM 资源争抢的代价。