diffusion 标签归档

共 2 篇文章 · 返回首页

【Transformer 与注意力机制】47|Diffusion + Transformer:DiT 与 Sora 为什么用 Transformer

DiT 把扩散模型的去噪网络从 U-Net 换成 Transformer,靠的是把图像压成 latent patch token、用 adaLN-Zero 注入时间步与类别条件。本文用论文原始 Gflops-FID 数据讲清这次替换的收益边界,用 O(n²) 公式解释视频时空 token 为什么比长文本更贵,并交代 U-Net 阵营的真实反驳证据。