📚 Study Notes

标签: RLHF

此标签下有2条笔记。

  • 2026年7月20日

    11.3 后训练范式

    • ml-ch11
    • machine-learning
    • 大语言模型
    • 后训练
    • 对齐
    • RLHF
  • 2026年7月20日

    11.4 基于人类反馈的强化学习

    • ml-ch11
    • machine-learning
    • RLHF
    • 人类反馈
    • 奖励模型
    • PPO

Created with Quartz v4.5.2 © 2026

  • GitHub