📚 Study Notes

标签: PPO

此标签下有2条笔记。

  • 2026年7月20日

    11.4 基于人类反馈的强化学习

    • ml-ch11
    • machine-learning
    • RLHF
    • 人类反馈
    • 奖励模型
    • PPO
  • 2026年7月20日

    11.5 近端策略优化算法

    • ml-ch11
    • machine-learning
    • PPO
    • 策略优化
    • 裁剪

Created with Quartz v4.5.2 © 2026

  • GitHub