基于策略的学习
核心思想
基于策略的学习(Policy-Based RL)直接对策略 进行参数化建模,并通过优化策略参数来最大化累积奖励。与基于价值的方法不同,策略方法不需要维护价值函数,而是直接在策略空间中搜索。
策略梯度方法
策略梯度定理给出了目标函数关于策略参数的梯度表达式:
优势:
- 天然适合连续动作空间问题
- 能够学习随机策略,在博弈论场景中很重要
- 可以处理价值方法难以解决的问题
在计算 时,仍会出现计算困难的问题,可以通过近似计算解决。
REINFORCE 算法
REINFORCE 是最简单的策略梯度算法,使用蒙特卡洛方法估计回报:
- 使用完整轨迹计算累积奖励
- 利用 作为 的无偏估计
- 更新方向:增加高回报动作的概率,降低低回报动作的概率
策略方法的局限性
- 方差较高(high variance),收敛速度较慢
- 容易收敛到局部最优
- 训练过程可能不稳定

链接到
- 上一个知识点:9.2 基于价值的学习
- 下一个知识点:9.4 Actor-Critic方法