本文定义后续文章会反复使用的符号。推荐阅读顺序是:先理解本文的交互要素与回报,再阅读 马尔可夫决策过程与马尔可夫奖励过程,最后阅读 贝尔曼方程与值函数学习。
一、强化学习在解决什么问题?#
强化学习研究智能体(agent)如何通过与环境(environment)交互,学习一个能够长期获得较大累积奖励的决策规则。
一次交互可以概括为:
环境执行动作,返回奖励 R_{t+1} 和下一个状态 S_{t+1}
强化学习的目标不是让某一步的奖励最大,而是让从当前时刻开始的长期折扣回报的期望最大。
二、时间下标与基本符号#
为了避免奖励和状态的下标混乱,本文采用下面的约定:
| 符号 | 含义 |
|---|
| St | 时间步 t 的状态随机变量;具体状态记为 s |
| At | 智能体在时间步 t 选择的动作随机变量;具体动作记为 a |
| Rt+1 | 执行动作 At 后、转移到下一状态之前或同时产生的奖励随机变量;具体奖励记为 r |
| St+1 | 环境转移后的下一状态随机变量;具体状态记为 s′ |
| (St,At,Rt+1,St+1) | 从时间步 t 到 t+1 的转移元组(transition) |
奖励写成 Rt+1 是为了表示:它通常是执行 At 这次转移的结果,而不是在已经到达 St+1 后才执行的动作。不同教材也可能把奖励记为 Rt,只要全文保持一致即可。
本文中:
- 大写字母表示随机变量,例如 St、At、Rt+1;
- 小写字母表示随机变量的具体取值,例如 s、a、r、s′;
- S、A、R 分别表示状态空间、动作空间和奖励取值集合。
三、状态与状态空间#
状态(state) 是智能体在某个时间步用于做决策的信息。所有可能状态组成状态空间:
St∈S.一个合适的状态应当包含预测未来奖励和未来状态所需的信息。后文的马尔可夫性会把这个要求形式化:如果当前状态已经包含了历史中与未来有关的信息,就不必再保存完整历史。
状态可以是:
- 离散变量,例如棋盘上的落子情况;
- 连续变量,例如机械臂关节的位置和速度;
- 多模态信息的组合,例如图像、传感器读数和任务变量的融合表示。
四、动作与动作空间#
动作(action) 是智能体在某个状态下可以执行的操作。所有动作组成动作空间:
At∈A.并非每个状态都允许执行所有动作,因此定义状态相关的可行动作集合:
A(s)⊆A.例如,在棋盘游戏中,A(s) 可以是不违反规则的落子位置;在机械控制中,动作可以是关节的控制量。
五、策略#
策略(policy) 描述智能体如何根据状态选择动作。随机策略写作:
π(a∣s)=P(At=a∣St=s),并满足归一化条件:
π(a∣s)≥0,a∈A(s)∑π(a∣s)=1.如果策略确定地选择一个动作,可以写作 a=π(s)。确定性策略也可以看成随机策略的特殊情况:被选择的动作概率为 1,其他动作概率为 0。
策略是智能体的行为规则,不是环境本身的一部分。给定相同的环境,改变策略就会改变智能体产生的轨迹分布。
六、奖励与环境转移#
6.1 奖励#
奖励(reward) 是环境在智能体执行动作后返回的标量反馈。奖励的正负和大小没有脱离任务的绝对含义,具体含义由奖励设计决定。
奖励可以是随机变量。常用的奖励分布为:
p(r∣s,a)=P(Rt+1=r∣St=s,At=a).如果只关心平均即时奖励,可以定义:
rˉ(s,a)=E[Rt+1∣St=s,At=a]=r∈R∑rp(r∣s,a).因此,r 是一次采样得到的具体奖励,而 rˉ(s,a) 是在 (s,a) 下奖励的条件期望。不要把二者混写成同一个对象。
6.2 状态转移#
环境根据当前状态和动作产生下一状态。离散状态下,状态转移概率为:
p(s′∣s,a)=P(St+1=s′∣St=s,At=a),满足:
p(s′∣s,a)≥0,s′∈S∑p(s′∣s,a)=1.奖励和下一状态可能相关,所以最一般地应使用联合分布:
p(r,s′∣s,a)=P(Rt+1=r,St+1=s′∣St=s,At=a).它的边缘分布为:
p(r∣s,a)=s′∑p(r,s′∣s,a),p(s′∣s,a)=r∑p(r,s′∣s,a).如果奖励还依赖于具体的下一状态,可以写成:
p(r,s′∣s,a)=p(s′∣s,a)p(r∣s,a,s′).这并不要求奖励和下一状态在给定 (s,a) 后相互独立;后续贝尔曼方程会直接使用联合分布,或分别使用两个边缘分布的期望。
七、轨迹与回合#
从初始状态开始,智能体和环境交互得到的一系列状态、动作和奖励称为轨迹(trajectory)。有限回合的一条样本轨迹可以写成:
τ=(s0,a0,r1,s1,a1,r2,…,aT−1,rT,sT),其中 sT 是终止状态。每一个时间步的局部转移是:
(st,at,rt+1,st+1),t=0,1,…,T−1.一次回合(episode)从初始状态开始,到终止状态结束;T 称为该回合的终止时间或范围(horizon)。如果任务没有自然终止状态,也可以设置最大步数,或者研究无限时域问题。
在固定策略和随机环境下,同一个策略可以产生多条不同轨迹。因此,轨迹、奖励和回报通常都是随机变量。
八、回报与折扣因子#
8.1 回报#
从时间步 t 开始直到回合结束,将即时奖励折扣后求和,得到折扣回报(return):
Gt=Rt+1+γRt+2+γ2Rt+3+⋯+γT−t−1RT=k=0∑T−t−1γkRt+k+1.到达终止状态后不再产生未来奖励,约定 GT=0。因此递推形式为:
Gt=Rt+1+γGt+1,并且当 St+1 为终止状态时,Gt=Rt+1。
对于无限时域,常写作:
Gt=k=0∑∞γkRt+k+1,但需要奖励有界且折扣条件足以保证该和收敛。
8.2 折扣因子#
折扣因子 γ 通常满足:
0≤γ<1.它的作用包括:
- 表示对未来奖励的重视程度;γ 越大,越重视长期收益;
- 让无限时域下的回报在适当条件下保持有限;
- 在有限时域任务中,也可以控制远期奖励对当前决策的影响。
在回合制任务中,γ 可以取 1,但此时需要依靠有限范围或其他条件保证回报有限。γ 不是奖励本身,而是计算长期回报时使用的权重。
九、强化学习的优化目标#
给定策略 π,从初始状态开始得到的回报是随机变量。策略的表现通常用期望回报衡量:
J(π)=Eπ[G0].强化学习的目标是寻找一个策略 π∗,使得:
π∗∈argπmaxJ(π).后续的状态价值函数和动作价值函数,正是把这个长期目标分解到每个状态或状态—动作对上的工具。
十、符号速查#
| 概念 | 符号 | 说明 |
|---|
| 状态空间 | S | 所有可能状态的集合 |
| 动作空间 | A | 所有可能动作的集合 |
| 可行动作集合 | A(s) | 状态 s 下允许执行的动作 |
| 策略 | π(a∣s) | 状态 s 下选择动作 a 的概率 |
| 状态转移概率 | p(s′∣s,a) | 执行 a 后到达 s′ 的概率 |
| 奖励分布 | p(r∣s,a) | 在 (s,a) 下得到奖励 r 的概率 |
| 平均即时奖励 | rˉ(s,a) | Rt+1 的条件期望 |
| 转移元组 | (St,At,Rt+1,St+1) | 一次环境交互 |
| 折扣回报 | Gt | 从 t 时刻开始的折扣奖励总和 |
| 折扣因子 | γ | 未来奖励的折扣权重 |
掌握这组符号后,可以把强化学习的核心链条记为:
状态和动作⟶策略与环境⟶轨迹⟶回报⟶价值函数.