强化学习基础笔记
符号表
先把常用符号列出来,后面用到可以回来查。
基本元素
| 符号 | 含义 | 说明 |
|---|---|---|
| 状态 | ||
| 状态空间 | 所有可能状态的集合 | |
| 动作 | 智能体采取的行动 | |
| 动作空间 | 所有可能动作的集合 | |
| 奖励 | 单步获得的即时奖励 | |
| 奖励函数 | 在状态 |
|
| 折扣因子 | ||
| 时间步 | 离散时间索引 |
概率与策略
| 符号 | 含义 | 说明 |
|---|---|---|
| 状态转移概率 | MRP 中,从 |
|
| 状态转移概率 | MDP 中,在 |
|
| 策略 | 在状态 |
|
| 最优策略 | 能获得最大累积奖励的策略 |
价值函数
| 符号 | 含义 | 说明 |
|---|---|---|
| 回报 | 从 |
|
| 状态价值函数 | 从状态 |
|
| 策略 |
按策略 |
|
| 最优状态价值 | 最优策略下的状态价值 | |
| 动作价值函数 | 在 |
|
| 策略 |
按策略 |
|
| 最优动作价值 | 最优策略下的动作价值 |
回报的定义
回报
价值函数就是回报的期望:
马尔可夫过程家族
强化学习的理论基础是马尔可夫过程。从简单到复杂,有这么几个层次:
MP(马尔可夫过程)
最简单的情况,只有状态和转移概率:
状态按概率自动转移,没有奖励,没有动作。比如天气变化:晴天 → 阴天 → 雨天,按某个概率矩阵转移。
MRP(马尔可夫奖励过程)
在 MP 基础上加入奖励:
现在每个状态有个奖励值,我们可以计算”从某个状态出发,期望能拿到多少总奖励”——这就是状态价值函数
但注意:MRP 里没有动作,状态是自动转移的。你只是一个观察者,不能做决策。
MDP(马尔可夫决策过程)
在 MRP 基础上加入动作和策略:
现在你可以在每个状态选择动作,不同的动作导致不同的转移概率和奖励。这才是真正的”决策”问题。
三者的关系
1 | MP → MRP → MDP |
反过来:MDP + 固定策略 = MRP。
当你在 MDP 中固定一个策略
奖励变成:
这时 MDP 就退化成了 MRP,可以用 MRP 的方法来分析。
贝尔曼方程
贝尔曼方程是强化学习的核心,描述了价值函数的递归结构。
MRP 的贝尔曼方程
对于 MRP,状态价值满足:
含义很直观:当前状态的价值 = 即时奖励 + 折扣后的未来价值期望。
写成矩阵形式:
这是一个线性方程组,直接求解:
看起来很简单,但问题是:
- 矩阵求逆是
,状态空间大了算不动 - 很多问题的状态空间是连续的,根本没法写成矩阵
MDP 的贝尔曼期望方程
对于 MDP,给定策略
这比 MRP 多了一层:先对动作求期望(按策略
类似地,动作价值函数
MDP 的贝尔曼最优方程
我们的目标不只是评估一个策略,而是找到最优策略。最优价值函数满足:
注意这里的
有了 $V^
问题是:贝尔曼最优方程是非线性的(因为有
MDP 求解方法
动态规划:已知模型
如果我们知道转移概率
策略评估(Policy Evaluation)
给定策略
思路:把贝尔曼期望方程当作迭代更新规则:
从任意初始值
为什么会收敛?因为这是一个压缩映射。定义算子
可以证明
由压缩映射定理,迭代必收敛到唯一不动点
策略改进(Policy Improvement)
有了
对每个状态,贪心地选择能最大化
策略改进定理:这样得到的
证明思路:
反复展开,最终得到
策略迭代(Policy Iteration)
把策略评估和策略改进结合起来:
- 初始化任意策略
- 策略评估:计算
- 策略改进:
- 如果
,停止;否则回到步骤 2
因为有限 MDP 的策略数量有限,且每次改进策略不会变差,所以必然在有限步内收敛到最优策略。
价值迭代(Value Iteration)
策略迭代每轮都要完整地做策略评估(可能需要很多次迭代),有点浪费。
价值迭代的思路:直接用贝尔曼最优方程迭代:
收敛后得到
可以理解为:策略迭代是”评估到底再改进”,价值迭代是”边评估边改进”。
无模型方法:未知模型
实际问题中,我们往往不知道
主要有两类:
蒙特卡洛(MC)方法:采样完整轨迹,用实际回报来估计价值函数。
优点是无偏,缺点是方差大,且必须等到 episode 结束。
时序差分(TD)方法:不用等到结束,用下一步的估计值来更新当前估计:
这里
TD 方法结合了 MC 的采样和动态规划的 bootstrapping,是强化学习中最常用的方法。
小结
| 概念 | 核心思想 |
|---|---|
| MRP | 无动作,状态自动转移,可直接求解 |
| MDP | 有动作,需要找最优策略 |
| 贝尔曼方程 | 价值函数的递归定义 |
| 策略迭代 | 评估 → 改进 → 评估 → … |
| 价值迭代 | 直接迭代贝尔曼最优方程 |
| MC/TD | 不知道模型时,从经验中学习 |
- 标题: 强化学习基础笔记
- 作者: Infy AI
- 创建于 : 2025-12-24 22:43:11
- 更新于 : 2025-12-28 10:19:59
- 链接: https://www.rasior.com/2025/12/24/rl-notes/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。