组相对策略优化算法(GRPO)
核心思想
组相对策略优化算法(Group Relative Policy Optimization, GRPO)是一种近年来提出的强化学习算法,特别适用于大语言模型的后训练对齐。与 PPO 需要依赖独立的价值网络(Critic) 来估计优势函数不同,GRPO 通过在同一组内对多个输出进行相对比较来估计优势,从而简化了训练流程。
GRPO 在 DeepSeek-R1 等模型中得到了成功应用,展示了优秀的对齐效果。

核心机制
GRPO 的工作流程如下:
- 组采样:对于同一个输入提示(prompt),从策略模型中采样多个输出
- 相对评分:使用奖励模型对组内的所有输出进行评分
- 组内归一化:将组内各输出的奖励值进行归一化处理,得到相对优势估计
- 策略优化:基于组内相对优势更新策略模型
GRPO 与 PPO 的对比
| 特性 | PPO | GRPO |
|---|---|---|
| 价值网络 | 需要独立的 Critic | 不需要 |
| 优势估计 | 基于价值网络 | 基于组内相对比较 |
| 实现复杂度 | 较高 | 较低 |
| 计算开销 | 需维护两个网络 | 仅需策略网络 |
| 适用性 | 通用 RL 场景 | 特别适合 LLM 对齐 |
GRPO 的优势
- 简化架构:无需独立的 Critic 网络,减少参数量和训练开销
- 自适应的优势估计:组内归一化自动适应奖励分布
- 计算效率:通过组内采样和一次前向传播完成多个样本的评估
- 稳定性:组内相对比较提供天然的优势基准,避免全局奖励漂移问题

应用场景
GRPO 特别适合以下场景:
- 大语言模型的后训练对齐(RLHF 替代方案)
- 需要简化训练流程的生产环境
- 奖励函数相对清晰但难以训练独立价值模型的任务
链接到
- 上一个知识点:11.5 近端策略优化算法
- 下一个知识点:11.7 大模型安全合规