强化学习基础笔记

Infy AI Lv2

符号表

先把常用符号列出来,后面用到可以回来查。

基本元素

符号 含义 说明
状态 是当前状态, 是下一个状态
状态空间 所有可能状态的集合
动作 智能体采取的行动
动作空间 所有可能动作的集合
奖励 单步获得的即时奖励
奖励函数 在状态 (执行动作 )获得的奖励
折扣因子 ,越小越短视
时间步 离散时间索引

概率与策略

符号 含义 说明
状态转移概率 MRP 中,从 转移到 的概率
状态转移概率 MDP 中,在 执行 后转移到 的概率
策略 在状态 下选择动作 的概率
最优策略 能获得最大累积奖励的策略

价值函数

符号 含义 说明
回报 时刻开始的累积折扣奖励
状态价值函数 从状态 出发能获得的期望回报
策略 下的状态价值 按策略 行动时, 的价值
最优状态价值 最优策略下的状态价值
动作价值函数 执行 后能获得的期望回报
策略 下的动作价值 按策略 行动时, 的价值
最优动作价值 最优策略下的动作价值

回报的定义

回报 是从 时刻开始的累积折扣奖励:

价值函数就是回报的期望:


马尔可夫过程家族

强化学习的理论基础是马尔可夫过程。从简单到复杂,有这么几个层次:

MP(马尔可夫过程)

最简单的情况,只有状态转移概率

状态按概率自动转移,没有奖励,没有动作。比如天气变化:晴天 → 阴天 → 雨天,按某个概率矩阵转移。

MRP(马尔可夫奖励过程)

在 MP 基础上加入奖励

现在每个状态有个奖励值,我们可以计算”从某个状态出发,期望能拿到多少总奖励”——这就是状态价值函数

但注意:MRP 里没有动作,状态是自动转移的。你只是一个观察者,不能做决策。

MDP(马尔可夫决策过程)

在 MRP 基础上加入动作策略

现在你可以在每个状态选择动作,不同的动作导致不同的转移概率和奖励。这才是真正的”决策”问题。

三者的关系

1
2
MP  →  MRP  →  MDP
+奖励 +动作

反过来:MDP + 固定策略 = MRP

当你在 MDP 中固定一个策略 后,动作就确定了,转移概率变成:

奖励变成:

这时 MDP 就退化成了 MRP,可以用 MRP 的方法来分析。


贝尔曼方程

贝尔曼方程是强化学习的核心,描述了价值函数的递归结构。

MRP 的贝尔曼方程

对于 MRP,状态价值满足:

含义很直观:当前状态的价值 = 即时奖励 + 折扣后的未来价值期望。

写成矩阵形式:

这是一个线性方程组,直接求解:

看起来很简单,但问题是:

  1. 矩阵求逆是 ,状态空间大了算不动
  2. 很多问题的状态空间是连续的,根本没法写成矩阵

MDP 的贝尔曼期望方程

对于 MDP,给定策略 ,状态价值满足:

这比 MRP 多了一层:先对动作求期望(按策略 的概率加权)。

类似地,动作价值函数 满足:

的关系:

MDP 的贝尔曼最优方程

我们的目标不只是评估一个策略,而是找到最优策略。最优价值函数满足:

注意这里的 :不是对动作求期望,而是取最优动作。

有了 $V^Q^$,最优策略就是:

问题是:贝尔曼最优方程是非线性的(因为有 ),没法像 MRP 那样直接矩阵求逆。


MDP 求解方法

动态规划:已知模型

如果我们知道转移概率 和奖励函数 (即”模型已知”),可以用动态规划求解。

策略评估(Policy Evaluation)

给定策略 ,求

思路:把贝尔曼期望方程当作迭代更新规则:

从任意初始值 开始,反复迭代, 会收敛到

为什么会收敛?因为这是一个压缩映射。定义算子

可以证明 -压缩的:

由压缩映射定理,迭代必收敛到唯一不动点

策略改进(Policy Improvement)

有了 ,怎么找更好的策略?

对每个状态,贪心地选择能最大化 值的动作:

策略改进定理:这样得到的 不会比 差,即 对所有 成立。

证明思路:

反复展开,最终得到

策略迭代(Policy Iteration)

把策略评估和策略改进结合起来:

  1. 初始化任意策略
  2. 策略评估:计算
  3. 策略改进
  4. 如果 ,停止;否则回到步骤 2

因为有限 MDP 的策略数量有限,且每次改进策略不会变差,所以必然在有限步内收敛到最优策略。

价值迭代(Value Iteration)

策略迭代每轮都要完整地做策略评估(可能需要很多次迭代),有点浪费。

价值迭代的思路:直接用贝尔曼最优方程迭代:

收敛后得到 ,再提取最优策略。

可以理解为:策略迭代是”评估到底再改进”,价值迭代是”边评估边改进”。

无模型方法:未知模型

实际问题中,我们往往不知道 ,只能通过和环境交互来学习。这就是无模型(model-free)方法。

主要有两类:

蒙特卡洛(MC)方法:采样完整轨迹,用实际回报来估计价值函数。

优点是无偏,缺点是方差大,且必须等到 episode 结束。

时序差分(TD)方法:不用等到结束,用下一步的估计值来更新当前估计:

这里 叫 TD target, 叫 TD error。

TD 方法结合了 MC 的采样和动态规划的 bootstrapping,是强化学习中最常用的方法。


小结

概念 核心思想
MRP 无动作,状态自动转移,可直接求解
MDP 有动作,需要找最优策略
贝尔曼方程 价值函数的递归定义
策略迭代 评估 → 改进 → 评估 → …
价值迭代 直接迭代贝尔曼最优方程
MC/TD 不知道模型时,从经验中学习
  • 标题: 强化学习基础笔记
  • 作者: Infy AI
  • 创建于 : 2025-12-24 22:43:11
  • 更新于 : 2025-12-28 10:19:59
  • 链接: https://www.rasior.com/2025/12/24/rl-notes/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。