scaling-laws 标签归档

共 3 篇文章 · 返回首页

【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

Kaplan(2020)第一次把 loss 随参数、数据、算力的幂律关系钉成经验规律,却因为训练配方设计的一个隐藏 bug 把配比钉歪了;Chinchilla(Hoffmann et al., 2022)用三种独立方法纠正过来,结论是很多大模型不是不够大,是每个参数看过的 token 不够多。本文用两篇论文的原始公式、Epoch AI 的复现危机和“过训/欠训”的真实工程后果,讲清楚 compute-optimal 到底在优化什么,以及这套规律正在被哪些新事实推着往前走。

【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么

GPT-1 到 GPT-4 四次跃迁里,next-token prediction 这个目标函数从未换过,真正变化的是任务接口、参数规模和对齐机制。本文只用公开论文与技术报告拆解每代的改与不改,并摆开 in-context learning 机制、涌现能力是否为度量假象、能力该归因 scale、数据还是对齐这几个仍在争论的问题。

【Transformer 与注意力机制】47|Diffusion + Transformer:DiT 与 Sora 为什么用 Transformer

DiT 把扩散模型的去噪网络从 U-Net 换成 Transformer,靠的是把图像压成 latent patch token、用 adaLN-Zero 注入时间步与类别条件。本文用论文原始 Gflops-FID 数据讲清这次替换的收益边界,用 O(n²) 公式解释视频时空 token 为什么比长文本更贵,并交代 U-Net 阵营的真实反驳证据。