基于人类反馈的强化学习

基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)是一种将人类偏好融入模型训练的技术框架。RLHF使语言模型的输出更加符合人类的期望,是ChatGPT等大语言模型实现对齐(Alignment)的核心技术。

基本流程

RLHF通常包含三个主要阶段:

阶段一:监督微调(SFT)

先在高质量的人工标注数据上对预训练语言模型进行监督微调,使模型具备基本的指令跟随能力。

阶段二:训练奖励模型(Reward Model, RM)

收集人类对模型输出的偏好比较数据(人类标注者对不同模型输出进行排序或评分),然后训练奖励模型来预测人类偏好:

其中 是人类偏好的输出, 是人类不偏好的输出, 是奖励模型。

阶段三:强化学习优化

使用奖励模型作为反馈信号,通过强化学习算法(通常为PPO)微调语言模型的策略:

其中 是当前策略模型, 是SFT阶段得到的参考模型, 是KL散度系数,用于防止策略偏离参考模型太远(避免模式崩塌)。

优势与挑战

优势

  • 使模型输出更加符合人类偏好和价值观
  • 减少有害、偏见性内容的生成
  • 提升模型在开放式任务中的表现

挑战

  • 人类标注成本高昂,需要大量标注者的参与
  • 奖励模型可能存在过拟合或捕获错误偏好
  • 强化学习训练过程不稳定,需要精心的超参数调优
  • 奖励欺骗(reward hacking)问题:模型可能学会利用奖励模型的漏洞而非真正改进性能

改进方法

后续研究中出现了多种RLHF的改进方法,包括DPO(Direct Preference Optimization)无需独立训练奖励模型即可进行偏好优化,以及GRPO(Group Relative Policy Optimization)通过组内相对比较代替奖励模型等。

链接到