土法炼钢兴趣小组的算法知识备份

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

文章导航

分类入口
transformer
标签入口
#transformer#rlhf#ppo#dpo#grpo#reward-model#alignment

Transformer系列导航

按系列顺序继续阅读,而不是停在单篇。

系列目录上一篇:【Transformer 与注意力机制】32|指令微调:把“会续写”变成“会听话”下一篇:【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

目录

32|指令微调 把 SFT 定性为”分布重定向”:用大量指令—回答样本,把模型的默认续写风格从互联网文本分布,重新锚定到”助手回答”这个更窄但更有产品价值的分布上。但重定向到哪个具体点,SFT 自己回答不了。同一个问题,模型可以给出多种都”像助手”的回答——更简洁但生硬,或更周到但啰嗦——SFT 的训练信号里没有任何东西能告诉模型这两者哪个更好,因为它的目标从头到尾都是最大化某一条给定参考答案的似然。

这不是数据量能解决的问题,是目标函数本身的表达力上限。真实世界的对齐问题,很多时候不是”有没有唯一正确答案”,而是”多个都不算错的答案里,人更喜欢哪个”。RLHF(Reinforcement Learning from Human Feedback)以及它后来的简化变体 DPO、GRPO,要回答的都是同一件事:怎么把”人更喜欢哪个”这个相对信号,写进一个可以梯度下降的训练目标。

系列分工:本篇钉住 Transformer 系列读者需要的主线直觉——RLHF 为什么在 SFT 之后出现、PPO 版本解决了什么又付出了什么代价、DPO 绕开了在线 RL 的哪一部分、GRPO 在什么场景下把 critic 也一起省掉。完整的四模型训练闭环、KL 系数自适应控制、DPO 的完整推导、奖励黑客的系统性缓解手段,见 强化学习与大模型后训练 系列,尤其是 09|RLHF 全链路10|DPO12|GRPO16|奖励黑客与对齐税;本篇不重复这几篇的公式推导与工程清单。

本篇能让你学会三件事:

  1. SFT 的似然目标天生画不出”相对偏好”这条线,问题出在优化目标本身,不是数据不够;
  2. PPO 版 RLHF 的 KL 约束、采样成本和几种可实测的不稳定症状分别从哪来,包括一条已经被实验量化的”reward 涨、真实质量先涨后跌”曲线;
  3. DPO 和 GRPO 分别放松了 PPO 的哪个假设、省下了什么、又把风险转移到了哪里,以及三条路线今天分别对应什么场景。

一、为什么 SFT 画不出偏好这条线

SFT 的监督信号是最大化给定回答的对数似然:

\[ \max_\theta \sum_t \log \pi_\theta(y_t \mid x, y_{<t}) \]

这个目标里没有任何一项在比较”这个回答”和”另一个也说得通的回答”。它只关心当前这条参考答案的概率有没有被推高。如果同一个 prompt 存在多个都合理但质量不同的回答,SFT 唯一能做的是把训练数据里出现的那个当作唯一正确答案去逼近,没有机制表达”这个比那个好,但那个也不算错”。

这不只是理论推演。Stiennon et al.(NeurIPS 2020,“Learning to Summarize from Human Feedback”)在 Reddit TL;DR 摘要任务上做过一个干净的对照:用人类偏好训练出的 1.3B 参数策略,在人工评测中有 61% 的概率被判定优于数据集里的人工参考摘要,而一个参数量大 10 倍的纯监督模型这个数字只有 43%;进一步放大到 6.7B 之后,人类反馈模型甚至被判定整体上优于人工撰写的参考摘要本身。这组数字说明的不是”RLHF 更贵所以更好”,而是监督模仿单一参考存在一个用规模换不出来的天花板——参数量差 10 倍都填不平这道沟,说明沟本身来自目标函数,不是容量。

Christiano et al.(NeurIPS 2017,“Deep Reinforcement Learning from Human Preferences”)更早从另一个方向指出了同一个问题:对于复杂目标,让人写出一个完美的示范往往比让人在两个候选里选一个更难、更贵。这篇论文没有讨论语言模型,但它确立的框架——用轨迹片段之间的成对比较学习奖励函数,而不是要求人工设计奖励或写出完美示范——正是后来 Ziegler et al.(2019)、Stiennon et al.(2020)把这套方法搬进语言模型微调,以及 Ouyang et al.(2022)把它系统化成 InstructGPT 训练流水线的起点。这条谱系说明 RLHF 不是”给 SFT 之后再加一步强化学习”的临时补丁,而是从一开始就针对”偏好比示范更容易表达、更容易大规模收集”这个具体假设设计出来的方法。


二、把偏好压成标量:奖励模型与 Bradley-Terry

要把”人更喜欢哪个”变成可以梯度下降的信号,第一步是训练一个奖励模型(reward model, RM)\(r_\phi(x, y)\),把 prompt-response 对映射成一个标量分数。训练数据是三元组 \((x, y_w, y_l)\)\(y_w\) 是标注员选出的更优回答,\(y_l\) 是较差回答。

建模这类成对比较的标准工具是 Bradley-Terry 模型(Bradley and Terry, Biometrika 1952),一篇讨论如何从不完全区组设计里的成对比较估计潜在得分的统计学经典论文,比语言模型早了七十年,但形式完全适用:

\[ P(y_w \succ y_l \mid x) = \sigma\big(r_\phi(x, y_w) - r_\phi(x, y_l)\big) \]

训练 RM 就是在偏好数据上最大化这个概率的对数似然,等价于最小化:

\[ \mathcal{L}_{RM}(\phi) = -\log \sigma\big(r_\phi(x, y_w) - r_\phi(x, y_l)\big) \]

这一步把”偏好”从一个只能靠人工判断的相对关系,变成了一个可以对任意新回答打分的连续函数。但它同时引入了一个后面反复出现的问题:\(r_\phi\) 只是在有限偏好数据覆盖的分布附近学到的代理目标,不是人类偏好的解析真值。它在训练分布内近似得不错,一旦策略生成的回答离这个分布越远,它给出的分数就越不可信——这正是第三节”不稳定症状”和第七节”奖励黑客”的根源,完整的 RM 训练细节、标注协议与过拟合诊断见 08|奖励模型


三、PPO 版 RLHF:KL 约束、采样成本与不稳定的具体症状

有了 \(r_\phi\),最直接的想法是把语言模型看成策略 \(\pi_\theta(y\mid x)\),直接最大化期望奖励。这个想法在语言模型上很危险:策略只要能自由探索,就会找到 RM 的漏洞——格式套话、过度自信、迎合标注偏好——而不是真的更符合人类意图。InstructGPT 的做法是在奖励上加一个”不要离 SFT 模型太远”的 KL 惩罚:

\[ \max_\theta \; \mathbb{E}_{x,\,y\sim\pi_\theta}\Big[r_\phi(x,y) - \beta\,\mathrm{KL}\big(\pi_\theta(\cdot\mid x)\,\|\,\pi_{ref}(\cdot\mid x)\big)\Big] \]

\(\pi_{ref}\) 通常是训练开始时冻结的 SFT 模型副本。这个约束不是可选的装饰:它定义了”偏离 SFT 行为”的代价,\(\beta\) 控制的是对齐收益和语言能力回退之间的张力。

采样成本:这个目标要用 PPO 之类的在线策略优化去逼近,代价是每一条训练样本都要经过策略自回归采样、参考模型前向、奖励模型打分、critic 估值四路计算。SFT 可以对固定答案做一次并行的 teacher forcing,RLHF 必须让当前策略自己一个 token 一个 token 生成训练样本,再回收计算优势。四个逻辑模型同时驻留显存、rollout 是自回归串行生成——这两条决定了 PPO-RLHF 的 wall-clock 成本远高于同等 token 数的 SFT,完整的四模型闭环、GAE 优势估计和 PPO 裁剪目标见 09|RLHF 全链路,本篇不重复。

不稳定的具体症状,不是抽象警告,是几组可以实测或已经被论文量化的现象:

第一,reward 涨、真实质量先涨后跌。Gao, Schulman and Hilton(ICML 2023,“Scaling Laws for Reward Model Overoptimization”)用一个更大的”gold-standard” RM 扮演真值,训练一个较小的 proxy RM 去逼近它,再观察策略针对 proxy RM 优化时,gold RM 打出的真实分数如何变化。结果符合古德哈特定律(Goodhart’s Law):随着策略与初始策略之间的 KL 距离拉大,proxy reward 单调上升,但 gold reward 只在 KL 较小时跟着涨,越过一个拐点后开始下降;这条关系的系数随 RM 参数量平滑变化,且强度受 RL 里 KL 惩罚系数直接调制。这是”奖励模型分数越高不代表真实质量越高”第一次被严格测量出具体函数形状,不是描述性的经验之谈。

第二,alignment tax(对齐税)在公开 NLP 基准上是可观测的具体回归。Ouyang et al.(2022)报告,默认 PPO 微调之后,模型在 SQuAD、DROP、HellaSwag、WMT’15 法英翻译等公开数据集上的表现相对 GPT-3 出现下降,论文把这类现象直接命名为 alignment tax。他们进一步做了一个对照实验:单纯调大 KL 系数确实能压低这类回归,但代价是验证奖励大幅下降,且在 DROP 和 SQuAD 上从未完全恢复;效果更好的做法是把预训练似然目标按一定系数混进 PPO 更新(PPO-ptx),这能在几乎不损失标注员偏好分数的前提下缓解回归,甚至在 HellaSwag 上反超 GPT-3,但在 DROP、SQuADv2 和翻译上仍然落后。这组对照说明两件事:alignment tax 是真实存在且可测量的,同时”单靠调大 KL”不是免费的解药,需要专门的工程手段去对冲。

第三,熵塌缩与裁剪比例异常。PPO 的裁剪目标(Schulman et al., arXiv:1707.06347, 2017)依赖旧策略和新策略的概率比 \(r_t(\theta)=\pi_\theta/\pi_{old}\),如果 rollout 明显滞后于当前参数,或者学习率过大,这个比值会大量落到裁剪区间之外,梯度被大范围吞掉;与此同时策略分布会过早变尖,熵持续下降,模型的输出多样性收窄,错误模式更难通过采样被发现。这类症状不会体现在”平均 reward 上升”这一个指标里,必须同时看 KL、熵、response length、clip fraction,稳定性监控的完整指标清单见 18|训练稳定性


四、DPO:从同一个 KL 目标里直接解出策略

DPO(Rafailov et al., NeurIPS 2023,“Direct Preference Optimization: Your Language Model Is Secretly a Reward Model”)问的问题很尖锐:如果最终能拿到的只是离线偏好对,能不能不显式训练 RM、不跑在线 rollout,直接从同一个 KL 正则目标解出策略?

第三节的目标对 \(\pi\) 求解,可以得到闭式最优策略:

\[ \pi^*(y\mid x) = \frac{1}{Z(x)}\,\pi_{ref}(y\mid x)\,\exp\!\left(\frac{1}{\beta}r(x,y)\right) \]

也就是说,最优策略不是凭空出现的,而是在参考策略上做了一次按奖励加权的指数倾斜。把这个式子两边取对数再反解,可以把奖励写成策略和参考策略的 log-ratio:

\[ r(x,y) = \beta\log\frac{\pi^*(y\mid x)}{\pi_{ref}(y\mid x)} + \beta\log Z(x) \]

关键的一步在这里:比较同一个 prompt 下两个回答时,只依赖 \(x\) 不依赖 \(y\)\(\beta\log Z(x)\) 会完全抵消。把这个奖励表达式代回 Bradley-Terry 偏好模型,用可训练的 \(\pi_\theta\) 近似 \(\pi^*\),就得到不含 \(Z(x)\) 的 DPO 损失:

\[ \mathcal{L}_{DPO}(\theta) = -\log\sigma\!\left(\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{ref}(y_w\mid x)} - \beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{ref}(y_l\mid x)}\right) \]

这个式子看起来像一个二分类损失,但每一项都有明确的 RLHF 来源:winner 的 log-ratio 应该变大,loser 的应该变小,reference 提供比较基准,\(\beta\) 对应原来的 KL 惩罚强度。省掉的东西非常直接——不需要单独训练 \(r_\phi\),不需要在线采样,也不需要 critic 和 PPO 的 ratio 裁剪;训练形态回到了普通的 teacher forcing + 反向传播。

代价也很直接。DPO 仍然需要 \(\pi_{ref}\):没有它,log-prob 会同时混入”回答质量”和”这句话本来就常见”两个因素,分不开。它只能从离线数据里学习:偏好对通常来自某个旧策略或多个模型的采样,训练后的 \(\pi_\theta\) 会逐渐离开这些数据覆盖的区域,而 DPO 没有在线奖励模型去校验新分布——这是纯粹的 off-policy 风险,PPO 至少还能用当前策略重新采样再打分。序列 log-prob 按 token 求和还带来长度偏置:更长的回答天然有更多 token 概率相加,数值上通常更负,这直接催生了 SimPO 这类做长度归一化的后续变体。完整推导、离线分布漂移的工程后果和 DPO 家族(IPO、KTO、ORPO、SimPO)的取舍对比,见 10|DPO11|DPO 家族


五、GRPO:可验证奖励场景下,把 critic 也一起省掉

PPO 的 critic 在语言模型上很别扭:奖励通常只在整段回答结束后才出现,中间几乎没有直接监督;prefix 组合空间几乎无限,critic 很难泛化;如果 critic 是独立训练的模型,又要多背一份显存和前向开销。GRPO(Group Relative Policy Optimization,出自 Shao et al., DeepSeekMath, arXiv:2402.03300, 2024)的动机很工程:同一个 prompt 一次采样 \(G\) 个回答,用组内奖励的均值和标准差直接构造 baseline,替代需要单独训练的价值网络:

\[ \hat A_i = \frac{r_i - \mathrm{mean}(r_1,\dots,r_G)}{\mathrm{std}(r_1,\dots,r_G)} \]

策略更新仍然保留 PPO 式的裁剪目标和 KL 约束,只是优势估计换成了组内相对分数,不再需要 critic。DeepSeek-R1 技术报告(DeepSeek-AI, arXiv:2501.12948, 2025)把这套方法放到了推理模型训练叙事的中心:在数学、代码这类答案可以被规则或程序判定对错的任务上,奖励不再来自可能被过优化的学习出来的 RM,而是来自外部验证器,“可验证奖励”(RLVR)和”组内相对优化”天然搭配——一个 prompt 采样出的一组答案里,有对有错,组内标准化直接给出有意义的优势信号。

边界也在这里:GRPO 省掉 critic 靠的是”同一个 prompt 能重复采样、奖励可以稳定复算”这个前提。如果任务的奖励来自一次昂贵的人工判断,或者天然只有两个候选(人类偏好数据常见的成对形式),组内相对化就没有自然的实现方式,退回到 PPO 或者 DPO 更合适;这条边界与可验证奖励能覆盖的任务范围,见 12|GRPO13|RLVR


六、三条路线放在同一张表里

维度 PPO-RLHF DPO GRPO
数据形态 在线采样 prompt-response 离线成对偏好 在线采样,同 prompt 一组 \(G\) 个回答
显式奖励模型 需要 不需要(隐式于 log-ratio) 通常用规则/验证器,也可用 RM
Critic 需要 不需要 不需要(组内统计替代)
探索能力 当前策略可产生新样本,由 RM 打分 受限于离线数据覆盖 当前策略可产生新样本,组内比较
主要风险 reward hacking、KL 失控、显存与吞吐成本 分布漂移、长度偏置、依赖成对数据 组内奖励零方差时优势塌缩、依赖可重复采样与可靠验证器
典型场景 通用偏好对齐的经典基线 已有高质量偏好对、离线对齐 数学/代码/规则可判定的推理任务

这张表不是排名。三条路线在解决”要不要在线探索”“要不要显式奖励模型”“奖励能不能廉价重复获取”这几个不同的问题,选择本身取决于数据形态和任务性质,不是越新越好。


七、争论:对齐税是可优化掉的成本,还是结构性风险

“对齐会不会损害能力”这个问题在文献里有两种不完全对立、但侧重点不同的回答。

第一种立场来自 Ouyang et al.(2022)自己给出的数据:alignment tax 是真实存在、可以在公开 NLP 基准上具体测出来的现象,但它可以被工程手段大幅缓解——混入预训练似然目标的 PPO-ptx 在几乎不损失标注员偏好分数的前提下逆转了大部分基准回归,某些基准甚至反超。这条证据支持的判断是:对齐税更接近一个可以持续优化的工程问题,不是必须接受的固定代价。

第二种立场来自对奖励模型本身的怀疑。Gao et al.(2023)测出的 Goodhart 曲线说明,即使公开基准上的回归被压得很小,也不能反过来推出”RM 高分等价于真实人类价值判断在所有分布上都对齐”——因为过优化现象的根源是 RM 作为有限偏好数据训练出来的代理目标,不是 KL 系数没调好。Casper et al.(2023,“Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback”,arXiv:2307.15217,未经 peer review,这里作为开放问题的综述性线索而非单独支撑结论)把这一点归纳为 RLHF 的结构性限制之一:标注者反馈本身有噪声、有偏差、覆盖有限,任何下游优化都只能在这个代理目标划定的范围内起作用。

这两种立场其实分别在谈论不同层面的”代价”:Ouyang 等人测量的是可观测、可对冲的具体基准回归;Casper 与 Gao 等人指出的是代理目标本身的不完备性,这类风险不会因为某一次调参而被彻底消除,只能通过更好的奖励设计、正则化手段或者像 RLVR 那样换成规则可验证的奖励信号去部分规避。奖励黑客的具体表现形式(长度膨胀、谄媚、格式套话)和系统性缓解手段,见 16|奖励黑客与对齐税


八、开放问题

  1. 没有 gold reward model 时,如何判断过优化已经发生? Gao et al.(2023)测出的 Goodhart 曲线依赖一个假设的”gold” RM 做校准,这在研究环境里可以人为构造,但真实产品里没有这个真值模型,只能靠更贵的人工评测或者其它代理信号去推测什么时候应该停止针对当前 RM 优化,目前没有不依赖 gold RM 的通用判据。
  2. GRPO 组内全对或全错时优势塌缩为零,规模化之后会不会更严重? Yu et al.(2025,“DAPO: An Open-Source LLM Reinforcement Learning System at Scale”,arXiv:2503.14476,未经 peer review)在复现 DeepSeek 规模的 RL 训练时实测到:随着策略变强,越来越多 prompt 的一组采样会全部答对或全部答错,导致组内标准差趋近于零、大量批次没有可用的梯度信号;他们用动态采样丢弃这类组来缓解,但没有理论结果说明这个比例在更大模型或更难任务分布下会如何变化。
  3. 对齐税能否被彻底消除,还是代理目标的结构性代价只是被转移了? 第七节的两种立场目前都有各自的实验支撑,但没有一篇工作在同一套评测口径下同时回答”公开基准回归”和”RM 过优化”这两类代价能不能被同一种工程手段一起解决,这需要更系统的跨方法对照。

九、关键概念回顾


十、常见误解

10.1 “RLHF 就是强化学习给模型提分”

太浅。它真正解决的是”如何把相对偏好变成可优化信号”,强化学习只是其中一种实现方式,DPO 已经证明这件事可以不用在线 RL 完成。

10.2 “有了 SFT 就不需要 RLHF / DPO 了”

不对。SFT 解决的是模仿单一示范,天花板由目标函数决定,不是数据规模;Stiennon et al.(2020)的实验已经证明这道沟不能靠扩大监督模型规模填平。

10.3 “DPO 完全取代了 PPO”

不对。DPO 用更强的离线假设换更低的工程复杂度,但一旦偏好数据没有覆盖某类回答,DPO 不会自己发现更好的答案;需要在线探索或奖励可验证时,PPO/GRPO 类方法仍然有空间。

10.4 “调大 KL 系数就能解决对齐税”

不对。Ouyang et al.(2022)的对照实验显示,单纯调大 KL 系数确实能压低基准回归,但代价是验证奖励大幅下降,且在 DROP、SQuAD 上从未完全恢复;更有效的做法是专门的工程手段(如混入预训练损失),不是简单地把 \(\beta\) 调大。

10.5 “奖励模型分数越高,模型就一定越好”

不对。这正是 Goodhart 曲线描述的现象:proxy reward 持续上升不代表真实质量持续上升,越过某个 KL 距离之后二者会分道。


十一、下一步

RLHF 这条线真正重要的地方,不在于给语言模型套上”强化学习”这层外衣,而在于它第一次系统地回答了”当正确答案不唯一时,怎样把相对偏好写进训练目标”。经典 PPO 版本给出了完整但昂贵的答案;DPO 用一个从同一目标推出的分类损失把训练成本打下来;GRPO 在可验证奖励场景里把 critic 也一起省掉。这三条路线解决的是”用什么信号、花多大成本对齐”,但都没有回答另一个问题:这些方法为什么在实践中普遍有效,效果会不会随着模型和数据规模继续变化。下一篇 34|Scaling Laws 就转向这条支撑所有训练阶段的规模化规律。


十二、参考文献

核心论文

  1. Christiano, P. F., Leike, J., Brown, T. B., Martic, M., Legg, S., Amodei, D. “Deep Reinforcement Learning from Human Preferences.” NeurIPS 2017(原 arXiv:1706.03741)。偏好式强化学习范式的起点,确立了”成对比较比设计奖励函数更容易”的核心假设。
  2. Bradley, R. A. and Terry, M. E. “Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons.” Biometrika 39(3/4), 1952. 奖励模型训练所用成对偏好模型的统计学原始出处。
  3. Stiennon, N. et al. “Learning to Summarize from Human Feedback.” NeurIPS 2020(原 arXiv:2009.01325)。Figure 1 给出 SFT 天花板的具体对照数字:1.3B 人类反馈模型以 61% 对 43% 的优势超过 10 倍参数量的纯监督模型。
  4. Ouyang, L. et al. “Training Language Models to Follow Instructions with Human Feedback.” NeurIPS 2022. InstructGPT,SFT→RM→PPO 完整流水线与 alignment tax 的原始测量(Figure 29/33/34)。
  5. Schulman, J. et al. “Proximal Policy Optimization Algorithms.” arXiv:1707.06347, 2017. PPO 裁剪目标原始论文。
  6. Gao, L., Schulman, J., Hilton, J. “Scaling Laws for Reward Model Overoptimization.” ICML 2023(原 arXiv:2210.10760)。用 gold RM 量化 proxy reward 与真实质量随 KL 距离先升后降的关系,本篇第三、七、八节的核心一手证据。
  7. Rafailov, R. et al. “Direct Preference Optimization: Your Language Model Is Secretly a Reward Model.” NeurIPS 2023. DPO 原始论文,隐式奖励推导的来源。
  8. Shao, Z. et al. “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.” arXiv:2402.03300, 2024. GRPO 原始论文。
  9. DeepSeek-AI. “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.” arXiv:2501.12948, 2025. 把 GRPO 与可验证奖励放到推理模型训练叙事中心的技术报告。
  10. Yu, Q. et al. “DAPO: An Open-Source LLM Reinforcement Learning System at Scale.” arXiv:2503.14476, 2025(未经 peer review)。GRPO 组内零优势塌缩现象的实测来源,本篇第八节开放问题之一。
  11. Casper, S. et al. “Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.” arXiv:2307.15217, 2023(未经 peer review,作为开放问题线索)。

站内交叉阅读


← 上一篇:32|指令微调 | 下一篇:34|Scaling Laws

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-08-08 · transformer

【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么

GPT-1 到 GPT-4 四次跃迁里,next-token prediction 这个目标函数从未换过,真正变化的是任务接口、参数规模和对齐机制。本文只用公开论文与技术报告拆解每代的改与不改,并摆开 in-context learning 机制、涌现能力是否为度量假象、能力该归因 scale、数据还是对齐这几个仍在争论的问题。

2026-08-08 · transformer

【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

Kaplan(2020)第一次把 loss 随参数、数据、算力的幂律关系钉成经验规律,却因为训练配方设计的一个隐藏 bug 把配比钉歪了;Chinchilla(Hoffmann et al., 2022)用三种独立方法纠正过来,结论是很多大模型不是不够大,是每个参数看过的 token 不够多。本文用两篇论文的原始公式、Epoch AI 的复现危机和“过训/欠训”的真实工程后果,讲清楚 compute-optimal 到底在优化什么,以及这套规律正在被哪些新事实推着往前走。

2026-08-08 · transformer

【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价

BERT 的每个设计选择都有可核对的实测代价。本文钉住 BERT 这一条路线本身:80/10/10 掩码策略真正缓解了多少 pretrain-finetune mismatch、NSP 为什么被 RoBERTa 的受控实验指出可能是输入格式而非目标函数在起作用、BERT 为什么在数学上是一个可以生成文本的 Markov Random Field 却没人拿它做生成模型,以及 2024 年之后 ModernBERT 一类工作为什么还在升级这条路线。三条路线的横向比较见 40|三大路线之争。


By .