基于价值的学习
核心思想
基于价值的学习(Value-Based RL)的核心是学习动作价值函数 ,即评估在某个状态下采取某个动作所能获得的期望回报。智能体的策略由价值函数隐式定义:在每个状态下,选择使 值最大的动作。
其中动作的选择是选择使 达到最大的 。
Q-learning
Q-learning 是一种经典的离线策略(off-policy) 价值迭代算法。其更新公式为:
特点:
- 直接学习最优策略的价值函数,而不依赖于当前策略
- 使用 算子进行目标值计算,可能导致过估计(overestimation)偏差
DQN(Deep Q-Network)
DQN 将深度学习与 Q-learning 结合,使用神经网络来近似 函数。其关键技术包括:
- 经验回放(Experience Replay):存储历史经验并随机采样,打破数据相关性
- 目标网络(Target Network):使用独立的网络计算目标 值,稳定训练过程
- -贪心策略:以 的概率随机探索,以 的概率选择最优动作
价值学习的局限性
- 难以处理连续动作空间(需要求解 )
- 值函数近似可能导致不收敛
- 对状态空间维度敏感

链接到
- 上一个知识点:9.1 强化学习基础
- 下一个知识点:9.3 基于策略的学习