📚 Study Notes
Search
搜索
暗色模式
亮色模式
📂 笔记目录
标签: PPO
此标签下有2条笔记。
2026年7月20日
11.4 基于人类反馈的强化学习
ml-ch11
machine-learning
RLHF
人类反馈
奖励模型
PPO
2026年7月20日
11.5 近端策略优化算法
ml-ch11
machine-learning
PPO
策略优化
裁剪