强化学习基础
强化学习的核心要素
强化学习问题通常建模为马尔可夫决策过程(Markov Decision Process, MDP),包含以下核心要素:
- 智能体(Agent):学习并做出决策的主体
- 环境(Environment):智能体交互的外部世界
- 动作(Action, A):智能体在每一步可以采取的行为
- 状态(State, S):环境在每一步的表示
- 奖励(Reward, R):环境对智能体动作的反馈信号
马尔可夫决策过程(MDP)
MDP 由元组 定义:
- :状态空间
- :动作空间
- :状态转移概率
- :奖励函数
- :折扣因子,用于平衡即时奖励和长期奖励
策略与价值
- 策略 :智能体在状态 下选择动作 的概率分布
- 回报(Return):从时间步 开始的累积折扣奖励
- 状态价值函数 :在状态 下遵循策略 所能获得的期望回报
- 动作价值函数 :在状态 下采取动作 后遵循策略 所能获得的期望回报
探索与利用(Exploration vs. Exploitation)
强化学习中的一个核心权衡:智能体需要在”利用已知的最优动作”和”探索未知的潜在更优动作”之间取得平衡。
.png)
链接到
- 上一个知识点:无(本章第一个知识点)
- 下一个知识点:9.2 基于价值的学习