基于策略的学习

核心思想

基于策略的学习(Policy-Based RL)直接对策略 进行参数化建模,并通过优化策略参数来最大化累积奖励。与基于价值的方法不同,策略方法不需要维护价值函数,而是直接在策略空间中搜索。

策略梯度方法

策略梯度定理给出了目标函数关于策略参数的梯度表达式:

优势:

  • 天然适合连续动作空间问题
  • 能够学习随机策略,在博弈论场景中很重要
  • 可以处理价值方法难以解决的问题

在计算 时,仍会出现计算困难的问题,可以通过近似计算解决。

REINFORCE 算法

REINFORCE 是最简单的策略梯度算法,使用蒙特卡洛方法估计回报:

  • 使用完整轨迹计算累积奖励
  • 利用 作为 的无偏估计
  • 更新方向:增加高回报动作的概率,降低低回报动作的概率

策略方法的局限性

  • 方差较高(high variance),收敛速度较慢
  • 容易收敛到局部最优
  • 训练过程可能不稳定

链接到