📚 Study Notes
Search
搜索
暗色模式
亮色模式
📂 笔记目录
标签: RLHF
此标签下有2条笔记。
2026年7月20日
11.3 后训练范式
ml-ch11
machine-learning
大语言模型
后训练
对齐
RLHF
2026年7月20日
11.4 基于人类反馈的强化学习
ml-ch11
machine-learning
RLHF
人类反馈
奖励模型
PPO