在人工智能的三大核心学习范式(监督学习、无监督学习、强化学习)中,强化学习(Reinforcement Learning,简称 RL)以其 “自主探索、动态交互” 的独特属性,成为实现复杂场景下智能决策的关键技术。从 AlphaGo 在围棋领域的颠覆性突破,到自动驾驶车辆在多变路况中的安全导航,再到机器人在工业场景中精准完成复杂装配任务,强化学习凭借 “从试错中学习、向奖励看齐” 的核心逻辑,不断拓展着人工智能的能力边界。

一. 强化学习基本概念:

1. 核心定义:

简单来说,强化学习是一种智能体(Agent)通过与环境(Environment)持续交互,在 “试错” 过程中学习最优决策策略,以最大化长期累积奖励(Cumulative Reward)为目标的机器学习方法。​

与依赖大量标注数据的监督学习(如 “图片 - 类别” 对应标注)、专注于挖掘数据内在规律的无监督学习(如聚类、降维)不同,强化学习的核心特征在于 “交互性” 与 “目标导向性”:​

  • 交互性:智能体并非被动接收数据,而是主动执行动作,改变环境状态,再根据环境反馈调整行为,形成 “感知 - 动作 - 反馈 - 优化” 的闭环;​

  • 目标导向性:整个学习过程围绕 “最大化长期奖励” 展开,智能体的每一次决策都服务于最终目标,而非追求单一步骤的短期收益。​

打个通俗的比方:强化学习如同训练一只小狗完成 “叼球” 任务 —— 小狗(智能体)在院子(环境)中尝试跑跳、叼取等动作(动作),主人会在它接近球时给予抚摸(正奖励),在它跑错方向时不予回应(无奖励),在它打翻花盆时予以制止(负奖励)。通过反复尝试与反馈,小狗逐渐学会 “快速找到球并叼回” 的最优行为模式(策略),这正是强化学习的核心逻辑在现实中的映射。

2. 核心角色:

智能体(Agent):相当于游戏中的 “玩家”,是做出决策并执行动作的主体。比如自动驾驶中的 “控制系统”、机器人的 “决策模块”,都可以看作是智能体。它的目标很明确 —— 通过一系列动作,最大化最终的 “奖励”。

环境(Environment)是智能体所处的 “游戏场景”,智能体的所有动作都在环境中发生,同时环境也会对智能体的动作做出反应。比如自动驾驶中的 “道路、其他车辆、行人、天气” 构成了环境;机器人工作的 “工厂车间、待装配零件、工具位置” 也是环境。环境的状态会随着智能体的动作不断变化。

3. 关键交互元素

状态(State,S):是对环境当前情况的描述,相当于游戏中 “玩家看到的画面信息”。比如自动驾驶中,“当前车速、与前车距离、红绿灯状态” 组合起来就是一个状态;机器人场景中,“机器人当前位置、手中是否持有零件、目标零件的位置” 也是一个状态。我们用s_t表示智能体在t时刻所处的状态。

动作(Action,A):是智能体在当前状态下可以做出的操作,相当于游戏中 “玩家按下的按键”。动作的选择会受到环境状态的限制,比如在自动驾驶中,当车辆处于 “红灯” 状态时,智能体可选择的动作是 “停车”,而不是 “前进”;当机器人处于 “目标零件在左侧” 的状态时,可选择的动作是 “向左移动”“伸出机械臂” 等。我们用a_t表示智能体在t时刻选择的动作。

奖励(Reward,R):是环境对智能体动作的 “反馈信号”,相当于游戏中 “玩家获得的分数”。奖励分为正奖励和负奖励,它直接决定了智能体的学习方向 —— 智能体的核心目标就是最大化 “累积奖励”。比如在自动驾驶中,“安全通过路口” 会获得正奖励,“与其他车辆发生碰撞” 会获得负奖励;在机器人装配任务中,“成功抓取零件” 获得正奖励,“零件掉落” 获得负奖励。我们用r_{t+1}表示智能体在t时刻执行动作a_t后,在t+1时刻获得的奖励。

4. 策略(Policy)

策略是智能体从 “环境状态” 到 “动作选择” 的映射规则,是智能体做出决策的核心依据,记为\pi(a|s) 。

其核心含义是 “在当前状态s下,智能体选择动作a的概率”。若为确定性策略,则在某一状态下仅对应一个确定动作(概率为 1,如 “红灯状态下必选停车动作”);若为随机性策略,则在某一状态下会以不同概率选择多个动作(如 “绿灯状态下 80% 概率匀速前进,20% 概率减速观察”)。

策略的本质是智能体的 “行为准则”,强化学习的核心目标就是通过与环境的交互,不断优化策略\pi,最终找到能最大化长期累积奖励(Return)的最优策略\pi*

二. 马尔科夫决策过程(MDP)

理解了基本概念后,我们需要一个严谨的数学框架来描述智能体与环境的交互过程,而马尔科夫决策过程(Markov Decision Process,MDP)就是这个 “骨架”。马尔科夫决策过程是描述随机动态系统的一般框架,它并不局限于强化学习,而是强化学习依赖于这个框架。

几乎所有经典的强化学习问题,都可以建模成 MDP 问题。MDP 通过量化“状态、动作、奖励、转移概率”,为强化学习提供了“智能体 - 环境交互”的数学建模工具,让“最大化长期累积奖励”的目标可通过算法计算与优化实现。

1. 马尔科夫性(Markov Property)

马尔科夫性指的是随机过程中的无记忆性,它在数学上表示为:

P(s_{t+1}|s_t,a_t,s_{t-1},a_{t-1}, \dots ,s_0,a_0)=P(s_{t+1}|s_t,a_t)

P(r_{t+1}|s_t,a_t,s_{t-1},a_{t-1}, \dots ,s_0,a_0)=P(r_{t+1}|s_t,a_t)

其中 t 表示当前时刻,t+1 表示下一时刻。上式表示下一个状态和奖励仅依赖于当前时刻的状态和动作,与之前时刻的状态和动作无关。

2. 关键要素(S、A、P、R、γ)

马尔科夫决策过程是描述随机动态系统的一般框架,它并不局限于强化学习,而是强化学习依赖于这个框架。MDP 由状态空间(S)、动作空间(A)、状态转移概率(P)、奖励函数(R)、折扣因子(γ)五要素构成。

状态空间(State Space,S)​

  1. 定义:所有可能环境状态的集合,记为S。每个状态s ∈ S都包含智能体决策所需的关键信息,且满足 “马尔科夫性”(未来状态仅依赖当前状态)。

  2. 实例:在 “迷宫逃生” 任务中,状态空间S是 “迷宫中所有格子的位置”(如S = {格子(1,1), 格子(1,2), ..., 格子(5,5), 出口});在自动驾驶场景中,S是 “车速、与前车距离、红绿灯状态” 等参数的所有组合(如S = {(30km/h, 5m,red), (40km/h, 10m,green)} )。

  3. 核心作用:明确当前所处的环境状态,为智能体提供 “决策依据”。

动作空间(Action Space,A)​

  1. 定义:智能体在任意状态下可执行的所有操作的集合。动作的选择会直接影响环境状态的转移。

  2. 实例:在 “围棋游戏” 中,动作空间A是 “棋盘上所有可落子的交叉点”(离散型,共 19×19=361 个动作);在 “机器人机械臂控制” 中,A是 “机械臂关节的旋转角度范围”(连续型,如 “0°-180° 的任意角度”)。​

  3. 核心作用:连接状态与状态转移的桥梁,定义智能体的 “决策范围”,即智能体“能做什么”。

状态转移概率(Transition Probability,P)​

  1. 定义:表示智能体在状态s下执行动作a后,转移到新状态s'的概率,记为 P(s'|s,a) 。它是环境 “随机性” 的数学表达 —— 即使在相同状态执行相同动作,环境也可能因噪声、干扰等因素转移到不同状态。​

  2. 实例:在 “机器人抓取零件” 任务中,若智能体在状态s(零件在机械臂正下方)执行动作a(抓取),因零件表面光滑,有 90% 概率成功抓取(转移到s_1:机械臂持有零件),10% 概率抓取失败(转移到s_2:零件掉落),此时 P(s_1 | s, a)=0.9 ,P(s_2 | s, a)=0.1 。​

  3. 核心作用:让智能体可预测动作的潜在结果,为策略优化提供概率依据。

奖励函数(Reward Function,R)​

  1. 定义:环境对智能体 “动作效果” 的反馈信号,记为R(s, a, s')(或简化为R(s, a)),表示在状态s执行动作a并转移到s'后获得的奖励值(可正、可负、可零)。它是引导智能体学习方向的 “指挥棒”。​

  2. 实例:在 “迷宫逃生” 中,奖励函数设计为:若从状态s执行动作a后到达出口(s'=出口),则R(s, a, s')=100(高额正奖励,鼓励目标行为);若撞到墙壁(s'=墙壁),则R(s, a, s')=-10(负奖励,规避错误行为)。​

  3. 核心作用:定义 “好坏标准”,让智能体明确 “哪些动作值得做”,是累积奖励最大化目标的核心依据。

折扣因子(Discount Factor,γ)​

  1. 定义:介于 0 到 1 之间的常数(0 ≤ γ ≤ 1),用于衡量 “未来奖励” 的权重。γ越接近 1,智能体越重视长期奖励;γ越接近 0,越关注即时奖励。​

  2. 实例:在 “围棋游戏” 中,γ通常设为 0.99—— 因为围棋需要长期布局,一步的短期收益(如吃一子)远不如最终获胜(长期高额奖励)重要;而在 “即时避障” 任务中,γ可设为 0.1—— 智能体需优先保证当前时刻不碰撞(即时奖励),远期安全可暂不考虑。​

  3. 核心作用:平衡 “短期收益与长期收益”,同时避免无限期任务中累积奖励趋于无穷大,确保目标函数可计算、可收敛。

3. 轨迹(Trajectory)、回报(Return)、回合(Episode)

轨迹:智能体与环境在一段时间内交互过程的完整记录

轨迹的核心构成:MDP 核心要素(S, A, R)的时间序列组合。其典型形式为:

\tau = (s_0,a_0,r_1,s_1,a_1,r_2,s_2,a_2,r_3,\dots,s_t,a_t,r_{t+1})

其中每个s_t\rightarrow a_t\rightarrow r_{t+1}\rightarrow s_{t+1}单元都是MDP中“状态转移”的一次具体实现。

整个轨迹覆盖了从状态 s_0 开始,到终止状态 s_t 结束的完整交互过程,其中t是交互的总时间步(若为无期限任务,t\rightarrow \infty )。在回合制任务(如迷宫逃生、游戏关卡)中,一条轨迹恰好对应一个回合的完整交互过程 —— 回合从初始状态 s_0开始生成轨迹,到终止状态 s_t 结束时,轨迹也随之完成,二者在时间范围上完全一致。

轨迹的作用:智能体通过与环境交互生成大量轨迹,这些轨迹中包含的 “s-t-a-r” 数据,是无模型强化学习(如 Q-Learning、SAC)更新策略的唯一依据;同时,回报(Return)也是 “基于轨迹中特定时间步后的奖励序列计算的”。

回报(Return):MDP 的核心目标量化指标

沿着一条轨迹,智能体会得到一系列的即时奖励,这些即时奖励之和被称为回报(或累积奖励)。

回报是基于 “奖励函数(R)” 和 “折扣因子(γ)” 计算得出的核心目标值,其公式为:

G_t=\sum_{k=0}^\infty \gamma ^k*r_{t+k+1}

输入:由奖励函数(R)生成的即时奖励(r)。

权重:由折扣因子(γ)决定 —— 平衡短期与长期奖励。

输出:量化 “从 t 时刻开始的长期累积收益”。

回报的本质是 “策略(π)价值的量化体现”—— 同一状态下,不同策略会产生不同的回报,智能体的学习过程就是 “寻找能最大化期望回报(E[G_t|\pi])的最优策略(\pi*)”。

不同强化学习算法通过不同方式利用回报优化策略:例如 Q-Learning 通过学习“状态 - 动作价值函数 Q (s,a)”间接逼近回报;策略梯度算法则直接对‘回报期望’求导,调整策略参数以提升长期收益。

回合(Episode):有终止状态的完整交互周期

回合:当执行一个策略进而与环境交互时,智能体从初始状态到终止状态停止的过程被称为一个回合(episode)或者尝试(trial)

一个回合包含多个时间步(Time Step),每个时间步对应一次s_t\rightarrow a_t\rightarrow r_{t+1}\rightarrow s_{t+1}的单次交互,回合的终止意味着该次交互周期的结束,下一个回合将从新的初始状态开始新的时间步序列。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐