基于价值的学习

核心思想

基于价值的学习(Value-Based RL)的核心是学习动作价值函数 ,即评估在某个状态下采取某个动作所能获得的期望回报。智能体的策略由价值函数隐式定义:在每个状态下,选择使 值最大的动作。

其中动作的选择是选择使 达到最大的

Q-learning

Q-learning 是一种经典的离线策略(off-policy) 价值迭代算法。其更新公式为:

特点:

  • 直接学习最优策略的价值函数,而不依赖于当前策略
  • 使用 算子进行目标值计算,可能导致过估计(overestimation)偏差

DQN(Deep Q-Network)

DQN 将深度学习与 Q-learning 结合,使用神经网络来近似 函数。其关键技术包括:

  • 经验回放(Experience Replay):存储历史经验并随机采样,打破数据相关性
  • 目标网络(Target Network):使用独立的网络计算目标 值,稳定训练过程
  • -贪心策略:以 的概率随机探索,以 的概率选择最优动作

价值学习的局限性

  • 难以处理连续动作空间(需要求解
  • 值函数近似可能导致不收敛
  • 对状态空间维度敏感

链接到