2026-08-08 | transformer | #transformer #scaling-laws #chinchilla #kaplan #compute-optimal #data-constrained-scaling
Kaplan(2020)第一次把 loss 随参数、数据、算力的幂律关系钉成经验规律,却因为训练配方设计的一个隐藏 bug 把配比钉歪了;Chinchilla(Hoffmann et al., 2022)用三种独立方法纠正过来,结论是很多大模型不是不够大,是每个参数看过的 token 不够多。本文用两篇论文的原始公式、Epoch AI 的复现危机和“过训/欠训”的真实工程后果,讲清楚 compute-optimal 到底在优化什么,以及这套规律正在被哪些新事实推着往前走。
2026-08-08 | transformer | #transformer #gpt #decoder-only #in-context-learning #scaling-laws #rlhf
GPT-1 到 GPT-4 四次跃迁里,next-token prediction 这个目标函数从未换过,真正变化的是任务接口、参数规模和对齐机制。本文只用公开论文与技术报告拆解每代的改与不改,并摆开 in-context learning 机制、涌现能力是否为度量假象、能力该归因 scale、数据还是对齐这几个仍在争论的问题。
2026-08-06 | transformer | #transformer #diffusion #dit #sora #video-generation #scaling-laws
DiT 把扩散模型的去噪网络从 U-Net 换成 Transformer,靠的是把图像压成 latent patch token、用 adaLN-Zero 注入时间步与类别条件。本文用论文原始 Gflops-FID 数据讲清这次替换的收益边界,用 O(n²) 公式解释视频时空 token 为什么比长文本更贵,并交代 U-Net 阵营的真实反驳证据。