【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO
SFT 的似然目标画不出相对偏好,只能到一个由数据规模决定的天花板。RLHF 用奖励模型把偏好压成标量再接 PPO,代价是 KL 约束、采样成本和可实测的奖励黑客曲线;DPO 从同一个 KL 目标解出隐式奖励绕开在线采样,GRPO 在可验证奖励场景把 critic 也省掉。工程细节外链 rl-posttraining 系列。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 9 篇文章 · 返回首页
SFT 的似然目标画不出相对偏好,只能到一个由数据规模决定的天花板。RLHF 用奖励模型把偏好压成标量再接 PPO,代价是 KL 约束、采样成本和可实测的奖励黑客曲线;DPO 从同一个 KL 目标解出隐式奖励绕开在线采样,GRPO 在可验证奖励场景把 critic 也省掉。工程细节外链 rl-posttraining 系列。
从 SFT、奖励模型到 PPO、DPO、GRPO 的完整对齐流水线工程实践,覆盖 OpenAI o1、DeepSeek-R1 等推理模型的 RL 路线与主流框架选型。
从 SFT 初始化、奖励模型、参考策略 KL 到 PPO 更新,串起 RLHF 的四模型训练闭环,并解释稳定性与工程成本。
解释 Actor-Critic 架构、优势估计和 GAE 的偏差—方差取舍,并映射到 LLM 后训练中的 value head 与 per-token advantage。
从信任域思想推到 PPO 裁剪目标,解释 KL 约束、完整损失和代码级实现细节,帮助读者判断一次策略更新是否安全。
解释 GRPO 如何用同一 prompt 下的组内相对奖励替代 critic,保留 PPO 式裁剪与 KL 约束,并分析 DeepSeek-R1 语境下的收益和偏置。
从 rollout、奖励计算、价值估计到策略更新,拆解 LLM 在线 RL 的系统拓扑、资源瓶颈和同步边界。
把 KL、奖励、熵、长度、梯度和 PPO 比率组织成训练仪表盘,定位后训练崩溃与奖励黑客。
从 MDP、策略梯度、PPO 等强化学习最小必要集出发,系统讲清现代大模型后训练:SFT、奖励模型、RLHF,到 DPO/IPO/KTO/ORPO/SimPO 免 RL 对齐、GRPO,再到 RLVR 可验证奖励、推理模型(o1/R1 范式)、过程奖励、奖励黑客、RL 训练基础设施与评测。全 20 篇深度博客。