critic 标签归档

共 1 篇文章 · 返回首页

【强化学习与大模型后训练】12｜GRPO：去掉 Critic 的组相对策略优化

解释 GRPO 如何用同一 prompt 下的组内相对奖励替代 critic，保留 PPO 式裁剪与 KL 约束，并分析 DeepSeek-R1 语境下的收益和偏置。