强化学习基础

强化学习的核心要素

强化学习问题通常建模为马尔可夫决策过程(Markov Decision Process, MDP),包含以下核心要素:

  • 智能体(Agent):学习并做出决策的主体
  • 环境(Environment):智能体交互的外部世界
  • 动作(Action, A):智能体在每一步可以采取的行为
  • 状态(State, S):环境在每一步的表示
  • 奖励(Reward, R):环境对智能体动作的反馈信号

马尔可夫决策过程(MDP)

MDP 由元组 定义:

  • :状态空间
  • :动作空间
  • :状态转移概率
  • :奖励函数
  • :折扣因子,用于平衡即时奖励和长期奖励

策略与价值

  • 策略 :智能体在状态 下选择动作 的概率分布
  • 回报(Return):从时间步 开始的累积折扣奖励
  • 状态价值函数 :在状态 下遵循策略 所能获得的期望回报
  • 动作价值函数 :在状态 下采取动作 后遵循策略 所能获得的期望回报

探索与利用(Exploration vs. Exploitation)

强化学习中的一个核心权衡:智能体需要在”利用已知的最优动作”和”探索未知的潜在更优动作”之间取得平衡。

链接到