组相对策略优化算法(GRPO)

核心思想

组相对策略优化算法(Group Relative Policy Optimization, GRPO)是一种近年来提出的强化学习算法,特别适用于大语言模型的后训练对齐。与 PPO 需要依赖独立的价值网络(Critic) 来估计优势函数不同,GRPO 通过在同一组内对多个输出进行相对比较来估计优势,从而简化了训练流程。

GRPO 在 DeepSeek-R1 等模型中得到了成功应用,展示了优秀的对齐效果。

核心机制

GRPO 的工作流程如下:

  1. 组采样:对于同一个输入提示(prompt),从策略模型中采样多个输出
  2. 相对评分:使用奖励模型对组内的所有输出进行评分
  3. 组内归一化:将组内各输出的奖励值进行归一化处理,得到相对优势估计
  4. 策略优化:基于组内相对优势更新策略模型

GRPO 与 PPO 的对比

特性PPOGRPO
价值网络需要独立的 Critic不需要
优势估计基于价值网络基于组内相对比较
实现复杂度较高较低
计算开销需维护两个网络仅需策略网络
适用性通用 RL 场景特别适合 LLM 对齐

GRPO 的优势

  • 简化架构:无需独立的 Critic 网络,减少参数量和训练开销
  • 自适应的优势估计:组内归一化自动适应奖励分布
  • 计算效率:通过组内采样和一次前向传播完成多个样本的评估
  • 稳定性:组内相对比较提供天然的优势基准,避免全局奖励漂移问题

应用场景

GRPO 特别适合以下场景:

  • 大语言模型的后训练对齐(RLHF 替代方案)
  • 需要简化训练流程的生产环境
  • 奖励函数相对清晰但难以训练独立价值模型的任务

链接到