1993 字
10 分钟
强化学习基础:交互要素、轨迹与回报

本文定义后续文章会反复使用的符号。推荐阅读顺序是:先理解本文的交互要素与回报,再阅读 马尔可夫决策过程与马尔可夫奖励过程,最后阅读 贝尔曼方程与值函数学习

一、强化学习在解决什么问题?#

强化学习研究智能体(agent)如何通过与环境(environment)交互,学习一个能够长期获得较大累积奖励的决策规则。

一次交互可以概括为:

智能体处于状态 S_t
↓ 根据策略选择动作 A_t
环境执行动作,返回奖励 R_{t+1} 和下一个状态 S_{t+1}
智能体根据 S_{t+1} 继续选择动作

强化学习的目标不是让某一步的奖励最大,而是让从当前时刻开始的长期折扣回报的期望最大。

二、时间下标与基本符号#

为了避免奖励和状态的下标混乱,本文采用下面的约定:

符号含义
StS_t时间步 tt 的状态随机变量;具体状态记为 ss
AtA_t智能体在时间步 tt 选择的动作随机变量;具体动作记为 aa
Rt+1R_{t+1}执行动作 AtA_t 后、转移到下一状态之前或同时产生的奖励随机变量;具体奖励记为 rr
St+1S_{t+1}环境转移后的下一状态随机变量;具体状态记为 ss'
(St,At,Rt+1,St+1)(S_t,A_t,R_{t+1},S_{t+1})从时间步 ttt+1t+1 的转移元组(transition)

奖励写成 Rt+1R_{t+1} 是为了表示:它通常是执行 AtA_t 这次转移的结果,而不是在已经到达 St+1S_{t+1} 后才执行的动作。不同教材也可能把奖励记为 RtR_t,只要全文保持一致即可。

本文中:

  • 大写字母表示随机变量,例如 StS_tAtA_tRt+1R_{t+1}
  • 小写字母表示随机变量的具体取值,例如 ssaarrss'
  • S\mathcal{S}A\mathcal{A}R\mathcal{R} 分别表示状态空间、动作空间和奖励取值集合。

三、状态与状态空间#

状态(state) 是智能体在某个时间步用于做决策的信息。所有可能状态组成状态空间:

StS.S_t \in \mathcal{S}.

一个合适的状态应当包含预测未来奖励和未来状态所需的信息。后文的马尔可夫性会把这个要求形式化:如果当前状态已经包含了历史中与未来有关的信息,就不必再保存完整历史。

状态可以是:

  • 离散变量,例如棋盘上的落子情况;
  • 连续变量,例如机械臂关节的位置和速度;
  • 多模态信息的组合,例如图像、传感器读数和任务变量的融合表示。

四、动作与动作空间#

动作(action) 是智能体在某个状态下可以执行的操作。所有动作组成动作空间:

AtA.A_t \in \mathcal{A}.

并非每个状态都允许执行所有动作,因此定义状态相关的可行动作集合:

A(s)A.\mathcal{A}(s) \subseteq \mathcal{A}.

例如,在棋盘游戏中,A(s)\mathcal{A}(s) 可以是不违反规则的落子位置;在机械控制中,动作可以是关节的控制量。

五、策略#

策略(policy) 描述智能体如何根据状态选择动作。随机策略写作:

π(as)=P(At=aSt=s),\pi(a\mid s)=P(A_t=a\mid S_t=s),

并满足归一化条件:

π(as)0,aA(s)π(as)=1.\pi(a\mid s)\ge 0, \qquad \sum_{a\in\mathcal{A}(s)}\pi(a\mid s)=1.

如果策略确定地选择一个动作,可以写作 a=π(s)a=\pi(s)。确定性策略也可以看成随机策略的特殊情况:被选择的动作概率为 11,其他动作概率为 00

策略是智能体的行为规则,不是环境本身的一部分。给定相同的环境,改变策略就会改变智能体产生的轨迹分布。

六、奖励与环境转移#

6.1 奖励#

奖励(reward) 是环境在智能体执行动作后返回的标量反馈。奖励的正负和大小没有脱离任务的绝对含义,具体含义由奖励设计决定。

奖励可以是随机变量。常用的奖励分布为:

p(rs,a)=P(Rt+1=rSt=s,At=a).p(r\mid s,a)=P(R_{t+1}=r\mid S_t=s,A_t=a).

如果只关心平均即时奖励,可以定义:

rˉ(s,a)=E[Rt+1St=s,At=a]=rRrp(rs,a).\bar r(s,a)=\mathbb{E}[R_{t+1}\mid S_t=s,A_t=a] =\sum_{r\in\mathcal{R}}r\,p(r\mid s,a).

因此,rr 是一次采样得到的具体奖励,而 rˉ(s,a)\bar r(s,a) 是在 (s,a)(s,a) 下奖励的条件期望。不要把二者混写成同一个对象。

6.2 状态转移#

环境根据当前状态和动作产生下一状态。离散状态下,状态转移概率为:

p(ss,a)=P(St+1=sSt=s,At=a),p(s'\mid s,a)=P(S_{t+1}=s'\mid S_t=s,A_t=a),

满足:

p(ss,a)0,sSp(ss,a)=1. p(s'\mid s,a)\ge 0, \qquad \sum_{s'\in\mathcal{S}}p(s'\mid s,a)=1.

奖励和下一状态可能相关,所以最一般地应使用联合分布:

p(r,ss,a)=P(Rt+1=r,St+1=sSt=s,At=a).p(r,s'\mid s,a)=P(R_{t+1}=r,S_{t+1}=s'\mid S_t=s,A_t=a).

它的边缘分布为:

p(rs,a)=sp(r,ss,a),p(ss,a)=rp(r,ss,a). p(r\mid s,a)=\sum_{s'}p(r,s'\mid s,a), \qquad p(s'\mid s,a)=\sum_r p(r,s'\mid s,a).

如果奖励还依赖于具体的下一状态,可以写成:

p(r,ss,a)=p(ss,a)p(rs,a,s).p(r,s'\mid s,a)=p(s'\mid s,a)p(r\mid s,a,s').

这并不要求奖励和下一状态在给定 (s,a)(s,a) 后相互独立;后续贝尔曼方程会直接使用联合分布,或分别使用两个边缘分布的期望。

七、轨迹与回合#

从初始状态开始,智能体和环境交互得到的一系列状态、动作和奖励称为轨迹(trajectory)。有限回合的一条样本轨迹可以写成:

τ=(s0,a0,r1,s1,a1,r2,,aT1,rT,sT),\tau=(s_0,a_0,r_1,s_1,a_1,r_2,\ldots,a_{T-1},r_T,s_T),

其中 sTs_T 是终止状态。每一个时间步的局部转移是:

(st,at,rt+1,st+1),t=0,1,,T1.(s_t,a_t,r_{t+1},s_{t+1}), \qquad t=0,1,\ldots,T-1.

一次回合(episode)从初始状态开始,到终止状态结束;TT 称为该回合的终止时间或范围(horizon)。如果任务没有自然终止状态,也可以设置最大步数,或者研究无限时域问题。

在固定策略和随机环境下,同一个策略可以产生多条不同轨迹。因此,轨迹、奖励和回报通常都是随机变量。

八、回报与折扣因子#

8.1 回报#

从时间步 tt 开始直到回合结束,将即时奖励折扣后求和,得到折扣回报(return)

Gt=Rt+1+γRt+2+γ2Rt+3++γTt1RT=k=0Tt1γkRt+k+1.G_t=R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots+\gamma^{T-t-1}R_T =\sum_{k=0}^{T-t-1}\gamma^kR_{t+k+1}.

到达终止状态后不再产生未来奖励,约定 GT=0G_T=0。因此递推形式为:

Gt=Rt+1+γGt+1,G_t=R_{t+1}+\gamma G_{t+1},

并且当 St+1S_{t+1} 为终止状态时,Gt=Rt+1G_t=R_{t+1}

对于无限时域,常写作:

Gt=k=0γkRt+k+1,G_t=\sum_{k=0}^{\infty}\gamma^kR_{t+k+1},

但需要奖励有界且折扣条件足以保证该和收敛。

8.2 折扣因子#

折扣因子 γ\gamma 通常满足:

0γ<1.0\le \gamma<1.

它的作用包括:

  1. 表示对未来奖励的重视程度;γ\gamma 越大,越重视长期收益;
  2. 让无限时域下的回报在适当条件下保持有限;
  3. 在有限时域任务中,也可以控制远期奖励对当前决策的影响。

在回合制任务中,γ\gamma 可以取 11,但此时需要依靠有限范围或其他条件保证回报有限。γ\gamma 不是奖励本身,而是计算长期回报时使用的权重。

九、强化学习的优化目标#

给定策略 π\pi,从初始状态开始得到的回报是随机变量。策略的表现通常用期望回报衡量:

J(π)=Eπ[G0].J(\pi)=\mathbb{E}_{\pi}[G_0].

强化学习的目标是寻找一个策略 π\pi^*,使得:

πargmaxπJ(π).\pi^*\in\arg\max_{\pi}J(\pi).

后续的状态价值函数和动作价值函数,正是把这个长期目标分解到每个状态或状态—动作对上的工具。

十、符号速查#

概念符号说明
状态空间S\mathcal{S}所有可能状态的集合
动作空间A\mathcal{A}所有可能动作的集合
可行动作集合A(s)\mathcal{A}(s)状态 ss 下允许执行的动作
策略π(as)\pi(a\mid s)状态 ss 下选择动作 aa 的概率
状态转移概率p(ss,a)p(s'\mid s,a)执行 aa 后到达 ss' 的概率
奖励分布p(rs,a)p(r\mid s,a)(s,a)(s,a) 下得到奖励 rr 的概率
平均即时奖励rˉ(s,a)\bar r(s,a)Rt+1R_{t+1} 的条件期望
转移元组(St,At,Rt+1,St+1)(S_t,A_t,R_{t+1},S_{t+1})一次环境交互
折扣回报GtG_ttt 时刻开始的折扣奖励总和
折扣因子γ\gamma未来奖励的折扣权重

掌握这组符号后,可以把强化学习的核心链条记为:

状态和动作策略与环境轨迹回报价值函数.\text{状态和动作} \longrightarrow \text{策略与环境} \longrightarrow \text{轨迹} \longrightarrow \text{回报} \longrightarrow \text{价值函数}.
强化学习基础:交互要素、轨迹与回报
https://biscuit0613.github.io/posts/reinforcement-learning/rl_basicconception/
作者
Biscuit
发布于
2025-11-02
许可协议
CC BY-NC-SA 4.0
强化学习笔记:贝尔曼方程、值函数与表格学习
强化学习笔记:马尔可夫决策过程(MDP)和马尔可夫奖励过程(MRP)