1735 字
9 分钟
强化学习笔记:马尔可夫决策过程(MDP)和马尔可夫奖励过程(MRP)

本文在强化学习基础定义的状态、动作、奖励和策略之上,引入马尔可夫性,并建立 MRP 与 MDP 的数学模型。

一、历史与马尔可夫性#

在时间步 tt,智能体已经经历的历史可以写成:

Ht=(S0,A0,R1,S1,A1,R2,,At1,Rt,St).H_t=(S_0,A_0,R_1,S_1,A_1,R_2,\ldots,A_{t-1},R_t,S_t).

历史包含当前状态以及之前的状态、动作和奖励。一般来说,未来可能依赖完整历史;如果当前状态已经包含了预测未来所需的全部信息,就可以使用马尔可夫性。

1. 马尔可夫性#

在强化学习中,给定当前状态和当前动作后,下一步的奖励和状态与更早的历史无关:

p(r,sHt,At=a)=p(r,sSt=s,At=a),St=s. p(r,s'\mid H_t,A_t=a) =p(r,s'\mid S_t=s,A_t=a), \qquad S_t=s.

等价地,可以分别写成:

p(sHt,At=a)=p(sSt=s,At=a), p(s'\mid H_t,A_t=a)=p(s'\mid S_t=s,A_t=a),p(rHt,At=a)=p(rSt=s,At=a). p(r\mid H_t,A_t=a)=p(r\mid S_t=s,A_t=a).

如果不显式考虑动作,普通随机过程的马尔可夫性是:

p(st+1s0,s1,,st)=p(st+1st). p(s_{t+1}\mid s_0,s_1,\ldots,s_t)=p(s_{t+1}\mid s_t).

注意:在 MDP 中,动作会影响环境,所以不能把带动作的转移写成缺少 aap(ss)p(s'\mid s)

2. 为什么马尔可夫性重要?#

马尔可夫性允许我们只使用当前状态进行决策和价值估计,而不用保存完整历史。例如,如果机器人状态只记录当前位置,却没有记录速度,而速度会影响下一时刻的运动,那么这个“状态”可能不满足马尔可夫性;加入速度后,状态表示可能就足够了。

因此,状态不只是观测到的某个数据,而是用于预测未来和决策的状态表示。若观测本身不满足马尔可夫性,就需要补充历史信息、使用状态估计,或使用能够处理历史的模型。

二、马尔可夫链与状态转移矩阵#

1. 没有动作的马尔可夫链#

马尔可夫链描述没有智能体动作参与的状态随机过程。其转移概率为:

p(ss)=P(St+1=sSt=s).p(s'\mid s)=P(S_{t+1}=s'\mid S_t=s).

当状态空间有限时,可以用状态转移矩阵 PP 表示:

Ps,s=P(ss).P_{s,s'}=P(s'\mid s).

本文采用“行表示当前状态、列表示下一状态”的约定,因此:

sSPs,s=1.\sum_{s'\in\mathcal{S}}P_{s,s'}=1.

例如,矩阵的第 ss 行描述从当前状态 ss 出发到所有可能下一状态的概率分布。

2. MDP 中的转移矩阵#

在 MDP 中,转移概率还依赖动作:

P(ss,a)=P(St+1=sSt=s,At=a).P(s'\mid s,a)=P(S_{t+1}=s'\mid S_t=s,A_t=a).

对于每一个固定动作 aa,都可以定义一个矩阵 PaP^a

Ps,sa=P(ss,a),sPs,sa=1.P^a_{s,s'}=P(s'\mid s,a), \qquad \sum_{s'}P^a_{s,s'}=1.

如果使用策略 π\pi 选择动作,动作随机性和环境随机性合在一起后,状态转移矩阵会变为策略诱导的矩阵:

Pπ(ss)=aA(s)π(as)P(ss,a).P^\pi(s'\mid s)=\sum_{a\in\mathcal{A}(s)}\pi(a\mid s)P(s'\mid s,a).

这个 PπP^\pi 是后面进行策略评估时使用的状态转移矩阵。

三、马尔可夫奖励过程(MRP)#

1. MRP 的定义#

马尔可夫奖励过程(Markov Reward Process, MRP)是在马尔可夫链的基础上加入奖励机制。一个有限状态的 MRP 通常由四元组表示:

(S,P,Rˉ,γ).(\mathcal{S},P,\bar R,\gamma).

其中:

  • S\mathcal{S} 是状态空间;
  • P(ss)P(s'\mid s) 是状态转移概率;
  • Rˉ(s)\bar R(s) 是从状态 ss 出发时奖励的期望;
  • γ\gamma 是折扣因子。

奖励随机变量仍记作 Rt+1R_{t+1}。奖励函数 Rˉ(s)\bar R(s) 是条件期望:

Rˉ(s)=E[Rt+1St=s].\bar R(s)=\mathbb{E}[R_{t+1}\mid S_t=s].

某些教材会直接把期望奖励写成 R(s)R(s)。为了避免和奖励随机变量混淆,本文使用 Rˉ(s)\bar R(s)

2. MDP 如何诱导出 MRP?#

MDP 中有动作,MRP 中没有动作。固定一个策略 π\pi 后,动作可以被策略的随机性平均掉,于是 MDP 变成一个 MRP:

Pπ(ss)=aπ(as)p(ss,a),P^\pi(s'\mid s)=\sum_a\pi(a\mid s)p(s'\mid s,a),Rˉπ(s)=aπ(as)rˉ(s,a),\bar R^\pi(s)=\sum_a\pi(a\mid s)\bar r(s,a),

其中:

rˉ(s,a)=E[Rt+1St=s,At=a].\bar r(s,a)=\mathbb{E}[R_{t+1}\mid S_t=s,A_t=a].

如果奖励和下一状态相关,也可以从联合分布得到策略诱导的奖励模型;对于价值函数的期望方程,只需要正确使用联合分布或对应边缘期望即可。

因此,MRP 可以理解为:在一个 MDP 上固定策略后,从环境视角看到的无动作随机过程

四、马尔可夫决策过程(MDP)#

1. MDP 的组成#

一个离散时间 MDP 可以用下列对象描述:

(S,A,p,ρ,γ).(\mathcal{S},\mathcal{A},p,\rho,\gamma).

其中:

  1. 状态空间 S\mathcal{S}:所有可能状态的集合;
  2. 动作空间 A\mathcal{A}:所有可能动作的集合;
  3. 可行动作集合 A(s)\mathcal{A}(s):在状态 ss 下允许执行的动作;
  4. 状态转移概率 p(ss,a)p(s'\mid s,a):在 ss 执行 aa 后到达 ss' 的概率;
  5. 奖励分布 ρ(r,ss,a)\rho(r,s'\mid s,a):执行动作后奖励和下一状态的联合分布;
  6. 折扣因子 γ\gamma:衡量未来奖励重要性的参数。

如果只分别记录奖励和状态的边缘分布,可以写成 p(rs,a)p(r\mid s,a)p(ss,a)p(s'\mid s,a)。如果奖励只依赖 (s,a)(s,a),常用平均奖励函数:

rˉ(s,a)=E[Rt+1St=s,At=a].\bar r(s,a)=\mathbb{E}[R_{t+1}\mid S_t=s,A_t=a].

奖励分布和转移分布都应满足归一化条件:

rsρ(r,ss,a)=1.\sum_r\sum_{s'}\rho(r,s'\mid s,a)=1.

2. 策略不是 MDP 的环境参数#

策略 π(as)\pi(a\mid s) 是智能体在 MDP 上采取的行为规则,不属于环境 MDP 的固定组成。策略满足:

π(as)0,aA(s)π(as)=1.\pi(a\mid s)\ge 0, \qquad \sum_{a\in\mathcal{A}(s)}\pi(a\mid s)=1.

同一个 MDP 可以使用不同策略;策略改变时,智能体采取的动作分布、轨迹分布和价值函数都会改变。

3. MDP 中的一次交互#

给定 St=sS_t=s,智能体按照 π\pi 采样动作 At=aA_t=a,环境再根据 p(r,ss,a)p(r,s'\mid s,a) 产生奖励和下一状态:

St=sπAt=a(Rt+1=r,St+1=s).S_t=s \xrightarrow[\pi]{A_t=a} (R_{t+1}=r,S_{t+1}=s').

这次交互可以记录为转移元组:

(St,At,Rt+1,St+1).(S_t,A_t,R_{t+1},S_{t+1}).

由初始状态分布 μ0\mu_0 和策略—环境组合得到的有限轨迹概率为:

pπ(τ)=μ0(s0)t=0T1π(atst)ρ(rt+1,st+1st,at).\begin{aligned} p_\pi(\tau) &=\mu_0(s_0)\prod_{t=0}^{T-1} \pi(a_t\mid s_t)\rho(r_{t+1},s_{t+1}\mid s_t,a_t). \end{aligned}

这个表达式说明:轨迹的随机性来自三个部分:初始状态、策略选择动作,以及环境生成奖励和下一状态。

五、模型已知与模型未知#

如果知道 p(ss,a)p(s'\mid s,a)、奖励分布和 γ\gamma,就可以用模型计算期望并进行动态规划,这属于**基于模型(model-based)**的方法。

如果只能通过交互得到样本 (St,At,Rt+1,St+1)(S_t,A_t,R_{t+1},S_{t+1}),而不知道完整的转移概率和奖励分布,就可以使用时序差分、SARSA 或 Q-learning 等**无模型(model-free)**方法直接从样本学习。

模型是否已知与策略是否随机是两件不同的事:一个已知模型可以配合随机策略,一个未知模型也可以用随机策略探索。

六、概念关系#

可以用下面的链条理解这些概念:

马尔可夫性MDP 模型固定策略 πMRP回报与价值函数.\text{马尔可夫性} \longrightarrow \text{MDP 模型} \xrightarrow{\text{固定策略 }\pi} \text{MRP} \longrightarrow \text{回报与价值函数}.

其中:

  • 马尔可夫性说明当前状态足以描述未来的条件分布;
  • MDP 描述带动作的智能体—环境交互;
  • 固定策略后,动作被平均掉,得到策略诱导的 MRP;
  • 价值函数衡量从状态或状态—动作对出发的期望折扣回报。

下一篇文章将从这些定义出发,推导贝尔曼方程,并介绍动态规划、TD、SARSA 和 Q-learning。

强化学习笔记:马尔可夫决策过程(MDP)和马尔可夫奖励过程(MRP)
https://biscuit0613.github.io/posts/reinforcement-learning/rl_markov/
作者
Biscuit
发布于
2025-11-02
许可协议
CC BY-NC-SA 4.0
强化学习基础:交互要素、轨迹与回报
UTF-8 编码与 Unicode,ASCII