GRPO:DeepSeek 用组内相对分数代替 Critic
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
PPO 要同时训 Actor 和 Critic。长思维链上价值网络又贵又不稳:一个答案可能上千 token,Critic 很难学会「想到一半值多少分」。DeepSeekMath(2024)提出 GRPO(Group Relative Policy Optimization),DeepSeek-R1 用它做推理向的强化学习。核心就一句:同一个问题采一组答案,用组内相对奖励当优势,不再单独学
。 RLHF 里如果你听到「R1 没用经典 PPO Critic」,指的就是这一章。

图解说明:基线是这
个数的均值,不是价值网络。全对或全错就没有梯度。
一、PPO 在长序列上的痛
PPO 的
- 多一个和 Actor 同量级的网络(内存、同步、调参);
- 稀疏终局奖励(对/错、验证器分数)让
的回归目标噪声极大; - 同一道题的不同采样,绝对分数不可比,但彼此相对很稳。
GRPO 的赌注:既然 anyway 都要对一个 prompt 采多个输出(为了探索),那就让这组输出互相当基线。
二、组相对优势
对每个问题
同一条
没有单独的
数字例。 同一题
逐步推导:组标准化优势代入 PPO 裁剪(点击展开)
GRPO 的策略目标与 PPO 同形:
若一组全对或全错,
三、目标函数:PPO 的壳,组相对的芯
比率仍是 PPO 的:
裁剪目标对组内每条输出、每个 token 求平均:
和 PPO 对齐着读:
| 零件 | PPO | GRPO |
|---|---|---|
| 概率比 + clip | 有 | 同一套 |
| 优势 | GAE + Critic | 组内 |
| KL 到参考策略 | 常作为奖励塑形 | 显式加在目标里(系数 |
| 每个 prompt 的样本 | 一条轨迹也行 | 必须成组( |
KL 项把策略拴在参考模型(SFT / 旧 checkpoint)上,作用等价于 RLHF 里那根「橡皮筋」,只是 GRPO 论文把它写进损失而不是改写标量奖励。

图解说明:左边 GAE+Critic,右边组内 z-score。
和 clip 是同一套壳。
四、为什么适合 DeepSeek 式的推理训练
R1 / Math 类任务有三个特点,和 GRPO 咬合:
- 可自动打分:数学、代码可以用最终答案或单测当
,不必每一步都有人类。 - 需要探索:同一道题必须看到对的和错的推理链,组内对比才有梯度。
- 序列很长:省掉价值网,训练栈更简单。
它不是「比 PPO 更强的万能算法」。没有组内方差时(
和 DPO 的差别也要分清:DPO 吃的是离线偏好对

图解说明:和 DPO 的差别——DPO 吃离线偏好对,GRPO 吃 on-policy 组采样。
五、接到 RLHF 之前你需要带走的
下一章 RLHF 会把 LLM 写成 MDP:状态是前缀,动作是 token。那里:
- 若走 InstructGPT 路线:奖励来自奖励模型,优化器是 PPO(带 KL);
- 若走 DeepSeek-R1 路线:奖励来自规则 / 验证器(外加少量偏好),优化器可以是 GRPO。
SFT、偏好数据、HHH 对齐,仍然是 RLHF 章的主题;裁剪、比率、优势、KL 已经在 PPO / 本章讲完,RLHF 只负责「这些符号在 token 序列上怎么对应」。
下一节 s21 RLHF:人类反馈、奖励模型和 DPO。PPO / GRPO 当工具用,不再展开推导。

图解说明:下一章只负责 SFT / RM / HHH / DPO,以及这些符号在 token 上怎么对应。
六、本节小结
| 概念 | 一句话 |
|---|---|
| 组 | 同一 prompt 下 |
| 相对优势 | |
| 目标 | PPO-Clip 套在 token 条件概率上 |
| KL | 拉住参考模型,防奖励黑客 |
| 适用 | 可验证、需多样采样的推理任务 |
| 不适用 |
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| exercise.py | Open | Download |
参考
- Shao, Z., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. [arXiv:2402.03300](提出 GRPO)
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. [arXiv:2501.12948]
- Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. [arXiv:1707.06347]