本文在强化学习基础定义的状态、动作、奖励和策略之上,引入马尔可夫性,并建立 MRP 与 MDP 的数学模型。
一、历史与马尔可夫性#
在时间步 t,智能体已经经历的历史可以写成:
Ht=(S0,A0,R1,S1,A1,R2,…,At−1,Rt,St).历史包含当前状态以及之前的状态、动作和奖励。一般来说,未来可能依赖完整历史;如果当前状态已经包含了预测未来所需的全部信息,就可以使用马尔可夫性。
1. 马尔可夫性#
在强化学习中,给定当前状态和当前动作后,下一步的奖励和状态与更早的历史无关:
p(r,s′∣Ht,At=a)=p(r,s′∣St=s,At=a),St=s.等价地,可以分别写成:
p(s′∣Ht,At=a)=p(s′∣St=s,At=a),p(r∣Ht,At=a)=p(r∣St=s,At=a).如果不显式考虑动作,普通随机过程的马尔可夫性是:
p(st+1∣s0,s1,…,st)=p(st+1∣st).注意:在 MDP 中,动作会影响环境,所以不能把带动作的转移写成缺少 a 的 p(s′∣s)。
2. 为什么马尔可夫性重要?#
马尔可夫性允许我们只使用当前状态进行决策和价值估计,而不用保存完整历史。例如,如果机器人状态只记录当前位置,却没有记录速度,而速度会影响下一时刻的运动,那么这个“状态”可能不满足马尔可夫性;加入速度后,状态表示可能就足够了。
因此,状态不只是观测到的某个数据,而是用于预测未来和决策的状态表示。若观测本身不满足马尔可夫性,就需要补充历史信息、使用状态估计,或使用能够处理历史的模型。
二、马尔可夫链与状态转移矩阵#
1. 没有动作的马尔可夫链#
马尔可夫链描述没有智能体动作参与的状态随机过程。其转移概率为:
p(s′∣s)=P(St+1=s′∣St=s).当状态空间有限时,可以用状态转移矩阵 P 表示:
Ps,s′=P(s′∣s).本文采用“行表示当前状态、列表示下一状态”的约定,因此:
s′∈S∑Ps,s′=1.例如,矩阵的第 s 行描述从当前状态 s 出发到所有可能下一状态的概率分布。
2. MDP 中的转移矩阵#
在 MDP 中,转移概率还依赖动作:
P(s′∣s,a)=P(St+1=s′∣St=s,At=a).对于每一个固定动作 a,都可以定义一个矩阵 Pa:
Ps,s′a=P(s′∣s,a),s′∑Ps,s′a=1.如果使用策略 π 选择动作,动作随机性和环境随机性合在一起后,状态转移矩阵会变为策略诱导的矩阵:
Pπ(s′∣s)=a∈A(s)∑π(a∣s)P(s′∣s,a).这个 Pπ 是后面进行策略评估时使用的状态转移矩阵。
三、马尔可夫奖励过程(MRP)#
1. MRP 的定义#
马尔可夫奖励过程(Markov Reward Process, MRP)是在马尔可夫链的基础上加入奖励机制。一个有限状态的 MRP 通常由四元组表示:
(S,P,Rˉ,γ).其中:
- S 是状态空间;
- P(s′∣s) 是状态转移概率;
- Rˉ(s) 是从状态 s 出发时奖励的期望;
- γ 是折扣因子。
奖励随机变量仍记作 Rt+1。奖励函数 Rˉ(s) 是条件期望:
Rˉ(s)=E[Rt+1∣St=s].某些教材会直接把期望奖励写成 R(s)。为了避免和奖励随机变量混淆,本文使用 Rˉ(s)。
2. MDP 如何诱导出 MRP?#
MDP 中有动作,MRP 中没有动作。固定一个策略 π 后,动作可以被策略的随机性平均掉,于是 MDP 变成一个 MRP:
Pπ(s′∣s)=a∑π(a∣s)p(s′∣s,a),Rˉπ(s)=a∑π(a∣s)rˉ(s,a),其中:
rˉ(s,a)=E[Rt+1∣St=s,At=a].如果奖励和下一状态相关,也可以从联合分布得到策略诱导的奖励模型;对于价值函数的期望方程,只需要正确使用联合分布或对应边缘期望即可。
因此,MRP 可以理解为:在一个 MDP 上固定策略后,从环境视角看到的无动作随机过程。
四、马尔可夫决策过程(MDP)#
1. MDP 的组成#
一个离散时间 MDP 可以用下列对象描述:
(S,A,p,ρ,γ).其中:
- 状态空间 S:所有可能状态的集合;
- 动作空间 A:所有可能动作的集合;
- 可行动作集合 A(s):在状态 s 下允许执行的动作;
- 状态转移概率 p(s′∣s,a):在 s 执行 a 后到达 s′ 的概率;
- 奖励分布 ρ(r,s′∣s,a):执行动作后奖励和下一状态的联合分布;
- 折扣因子 γ:衡量未来奖励重要性的参数。
如果只分别记录奖励和状态的边缘分布,可以写成 p(r∣s,a) 与 p(s′∣s,a)。如果奖励只依赖 (s,a),常用平均奖励函数:
rˉ(s,a)=E[Rt+1∣St=s,At=a].奖励分布和转移分布都应满足归一化条件:
r∑s′∑ρ(r,s′∣s,a)=1.2. 策略不是 MDP 的环境参数#
策略 π(a∣s) 是智能体在 MDP 上采取的行为规则,不属于环境 MDP 的固定组成。策略满足:
π(a∣s)≥0,a∈A(s)∑π(a∣s)=1.同一个 MDP 可以使用不同策略;策略改变时,智能体采取的动作分布、轨迹分布和价值函数都会改变。
3. MDP 中的一次交互#
给定 St=s,智能体按照 π 采样动作 At=a,环境再根据 p(r,s′∣s,a) 产生奖励和下一状态:
St=sAt=aπ(Rt+1=r,St+1=s′).这次交互可以记录为转移元组:
(St,At,Rt+1,St+1).由初始状态分布 μ0 和策略—环境组合得到的有限轨迹概率为:
pπ(τ)=μ0(s0)t=0∏T−1π(at∣st)ρ(rt+1,st+1∣st,at).这个表达式说明:轨迹的随机性来自三个部分:初始状态、策略选择动作,以及环境生成奖励和下一状态。
五、模型已知与模型未知#
如果知道 p(s′∣s,a)、奖励分布和 γ,就可以用模型计算期望并进行动态规划,这属于**基于模型(model-based)**的方法。
如果只能通过交互得到样本 (St,At,Rt+1,St+1),而不知道完整的转移概率和奖励分布,就可以使用时序差分、SARSA 或 Q-learning 等**无模型(model-free)**方法直接从样本学习。
模型是否已知与策略是否随机是两件不同的事:一个已知模型可以配合随机策略,一个未知模型也可以用随机策略探索。
六、概念关系#
可以用下面的链条理解这些概念:
马尔可夫性⟶MDP 模型固定策略 πMRP⟶回报与价值函数.其中:
- 马尔可夫性说明当前状态足以描述未来的条件分布;
- MDP 描述带动作的智能体—环境交互;
- 固定策略后,动作被平均掉,得到策略诱导的 MRP;
- 价值函数衡量从状态或状态—动作对出发的期望折扣回报。
下一篇文章将从这些定义出发,推导贝尔曼方程,并介绍动态规划、TD、SARSA 和 Q-learning。