30 秒快速回答:GRPO(Group Relative Policy Optimization,群体相对策略优化)是 DeepSeek 提出的强化学习算法。它让模型对同一个问题生成一组多个答案,然后拿这组答案内部互相对比打分来更新模型,从而省掉了 PPO 里那套庞大的”价值模型”,用更少的显存和更低的成本,把大模型训练成会”慢思考”的推理高手——DeepSeek-R1 的推理能力正是靠它炼成的。
一句话价值:理解 GRPO,你就理解了 2025 年以来推理模型(R1、o 系列)能”涌现”出解题能力的关键训练技术。
一、从 RLHF 到 PPO:为什么需要新算法
要让大模型”会推理、对齐人类偏好”,主流路线是 RLHF(基于人类反馈的强化学习),其中 PPO(Proximal Policy Optimization)是应用最广的算法。
PPO 的训练需要四个角色协同工作:
| 角色 | 作用 |
|---|---|
| 策略模型(Actor) | 生成回答的模型,正在被训练 |
| 参考模型(Reference) | 冻结的原始模型,用来约束策略别跑偏 |
| 奖励模型(Reward Model) | 给回答打分,需要单独训练 |
| 价值模型(Critic) | 估算”当前状态能得多少分”,是 PPO 的累赘 |
问题就出在价值模型(Critic)上:它和策略模型一样大,意味着显存占用接近翻倍,训练成本高、工程复杂,而且 Critic 本身还要训练得准,否则会拖累整个训练。
GRPO 的核心洞察是:能不能不要 Critic?
二、GRPO 的核心思想:组内互比,无需价值模型
GRPO 的解法非常优雅——对一个问题,让模型同时生成一组(Group)多个答案,然后用这组答案的平均分作为基线(baseline),把每个答案的分数相对这个基线做归一化,好答案得到正奖励、差答案得到负奖励。
这样一来,不再需要 Critic 去”预测”分数,直接用组内真实采样结果互相比较,基线天然、稳定、免费。
用一段伪代码直观感受一下:
def grpo_update(policy, question, reward_fn, group_size=8):
# 1. 对同一问题采样一组答案
answers = [policy.sample(question) for _ in range(group_size)]
# 2. 用奖励函数(如答案正确性)给每个答案打分
rewards = [reward_fn(question, a) for a in answers]
# 3. 以组内平均分为基线,做相对归一化
mean, std = sum(rewards) / group_size, stddev(rewards)
advantages = [(r - mean) / std for r in rewards]
# 4. 用相对优势更新策略,好答案的概率被抬高
policy.gradient_step(answers, advantages)
return policy
对比 PPO 与 GRPO,差异一目了然:
| 维度 | PPO | GRPO |
|---|---|---|
| 是否需要价值模型 | 需要(Critic,与策略同规模) | 不需要 |
| 基线来源 | Critic 预测的状态价值 | 组内样本平均分 |
| 显存开销 | 高(约翻倍) | 低 |
| 采样方式 | 逐条采样 | 按组采样(如每组 8 条) |
| 代表性应用 | ChatGPT、早期 InstructGPT | DeepSeek-R1 系列 |
三、GRPO 如何让 R1 学会推理:奖励设计是灵魂
DeepSeek-R1 用 GRPO 训练时,最大的亮点不是算法本身,而是奖励函数的设计——它没有使用人类偏好奖励模型,而是用两条硬规则给推理题打分:
- 准确性奖励:答案最终是否正确(比如数学题算对没、代码能不能通过测试)。
- 格式奖励:是否把思考过程放在了
<think>和</think>标签之间。
两条奖励都不依赖人类标注,直接由规则自动判定,省去了训练奖励模型的成本。正是在这套奖励信号的驱动下,R1 在训练中出现了著名的”啊哈时刻“——模型在没有被显式教导的情况下,自己学会了”等等,让我重新检查一遍”这类反思行为,解题正确率随之飙升。
四、GRPO 的优势与局限
优势:显存占用更低(省掉 Critic);训练更稳定(组内相对基线天然抑制方差);无需训练奖励模型即可对数学、代码这类可自动判分的任务进行大规模强化学习。
局限:对”开放式主观题”(如写作文、聊天)不友好,因为难以用硬规则打分,仍需奖励模型或人类反馈;组采样增加了推理时的计算量;组大小、KL 约束强度等超参数需要精心调节。
总结要点
- GRPO 用”组内互相比”替代 PPO 的 Critic,大幅降低显存与训练成本。
- 它的核心是相对优势(组内归一化),让模型学会”好答案更好、坏答案更坏”。
- DeepSeek-R1 靠”准确性 + 格式”两条规则奖励,用 GRPO 炼出了强大的慢思考推理能力。
- GRPO 特别适合数学、代码等可自动判分的推理任务,是理解推理模型的关键拼图。
延伸阅读
- 官方论文《DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models》(GRPO 首次提出)
- 官方论文《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
- 本站《什么是推理模型?o1/R1 慢思考原理全解析》《什么是 RLHF?大模型对齐人类偏好的核心技术》