基于人类反馈的强化学习
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)是一种将人类偏好融入模型训练的技术框架。RLHF使语言模型的输出更加符合人类的期望,是ChatGPT等大语言模型实现对齐(Alignment)的核心技术。
基本流程
RLHF通常包含三个主要阶段:
阶段一:监督微调(SFT)
先在高质量的人工标注数据上对预训练语言模型进行监督微调,使模型具备基本的指令跟随能力。
阶段二:训练奖励模型(Reward Model, RM)
收集人类对模型输出的偏好比较数据(人类标注者对不同模型输出进行排序或评分),然后训练奖励模型来预测人类偏好:
其中 是人类偏好的输出, 是人类不偏好的输出, 是奖励模型。
阶段三:强化学习优化
使用奖励模型作为反馈信号,通过强化学习算法(通常为PPO)微调语言模型的策略:
其中 是当前策略模型, 是SFT阶段得到的参考模型, 是KL散度系数,用于防止策略偏离参考模型太远(避免模式崩塌)。
优势与挑战
优势:
- 使模型输出更加符合人类偏好和价值观
- 减少有害、偏见性内容的生成
- 提升模型在开放式任务中的表现
挑战:
- 人类标注成本高昂,需要大量标注者的参与
- 奖励模型可能存在过拟合或捕获错误偏好
- 强化学习训练过程不稳定,需要精心的超参数调优
- 奖励欺骗(reward hacking)问题:模型可能学会利用奖励模型的漏洞而非真正改进性能
改进方法
后续研究中出现了多种RLHF的改进方法,包括DPO(Direct Preference Optimization)无需独立训练奖励模型即可进行偏好优化,以及GRPO(Group Relative Policy Optimization)通过组内相对比较代替奖励模型等。
链接到
- 上一个知识点:11.3 后训练范式
- 下一个知识点:11.5 近端策略优化算法
- 相关知识点:9.4 Actor-Critic方法