强化学习入门(1)基本概念与马尔科夫决策
在人工智能的三大核心学习范式(监督学习、无监督学习、强化学习)中,强化学习(Reinforcement Learning,简称 RL)以其 “自主探索、动态交互” 的独特属性,成为实现复杂场景下智能决策的关键技术。从 AlphaGo 在围棋领域的颠覆性突破,到自动驾驶车辆在多变路况中的安全导航,再到机器人在工业场景中精准完成复杂装配任务,强化学习凭借 “从试错中学习、向奖励看齐” 的核心逻辑,不断拓展着人工智能的能力边界。
一. 强化学习基本概念:
1. 核心定义:
简单来说,强化学习是一种智能体(Agent)通过与环境(Environment)持续交互,在 “试错” 过程中学习最优决策策略,以最大化长期累积奖励(Cumulative Reward)为目标的机器学习方法。
与依赖大量标注数据的监督学习(如 “图片 - 类别” 对应标注)、专注于挖掘数据内在规律的无监督学习(如聚类、降维)不同,强化学习的核心特征在于 “交互性” 与 “目标导向性”:
-
交互性:智能体并非被动接收数据,而是主动执行动作,改变环境状态,再根据环境反馈调整行为,形成 “感知 - 动作 - 反馈 - 优化” 的闭环;
-
目标导向性:整个学习过程围绕 “最大化长期奖励” 展开,智能体的每一次决策都服务于最终目标,而非追求单一步骤的短期收益。
打个通俗的比方:强化学习如同训练一只小狗完成 “叼球” 任务 —— 小狗(智能体)在院子(环境)中尝试跑跳、叼取等动作(动作),主人会在它接近球时给予抚摸(正奖励),在它跑错方向时不予回应(无奖励),在它打翻花盆时予以制止(负奖励)。通过反复尝试与反馈,小狗逐渐学会 “快速找到球并叼回” 的最优行为模式(策略),这正是强化学习的核心逻辑在现实中的映射。
2. 核心角色:
智能体(Agent):相当于游戏中的 “玩家”,是做出决策并执行动作的主体。比如自动驾驶中的 “控制系统”、机器人的 “决策模块”,都可以看作是智能体。它的目标很明确 —— 通过一系列动作,最大化最终的 “奖励”。
环境(Environment):是智能体所处的 “游戏场景”,智能体的所有动作都在环境中发生,同时环境也会对智能体的动作做出反应。比如自动驾驶中的 “道路、其他车辆、行人、天气” 构成了环境;机器人工作的 “工厂车间、待装配零件、工具位置” 也是环境。环境的状态会随着智能体的动作不断变化。
3. 关键交互元素
状态(State,S):是对环境当前情况的描述,相当于游戏中 “玩家看到的画面信息”。比如自动驾驶中,“当前车速、与前车距离、红绿灯状态” 组合起来就是一个状态;机器人场景中,“机器人当前位置、手中是否持有零件、目标零件的位置” 也是一个状态。我们用表示智能体在
时刻所处的状态。
动作(Action,A):是智能体在当前状态下可以做出的操作,相当于游戏中 “玩家按下的按键”。动作的选择会受到环境状态的限制,比如在自动驾驶中,当车辆处于 “红灯” 状态时,智能体可选择的动作是 “停车”,而不是 “前进”;当机器人处于 “目标零件在左侧” 的状态时,可选择的动作是 “向左移动”“伸出机械臂” 等。我们用表示智能体在
时刻选择的动作。
奖励(Reward,R):是环境对智能体动作的 “反馈信号”,相当于游戏中 “玩家获得的分数”。奖励分为正奖励和负奖励,它直接决定了智能体的学习方向 —— 智能体的核心目标就是最大化 “累积奖励”。比如在自动驾驶中,“安全通过路口” 会获得正奖励,“与其他车辆发生碰撞” 会获得负奖励;在机器人装配任务中,“成功抓取零件” 获得正奖励,“零件掉落” 获得负奖励。我们用表示智能体在t时刻执行动作
后,在
时刻获得的奖励。
4. 策略(Policy)
策略是智能体从 “环境状态” 到 “动作选择” 的映射规则,是智能体做出决策的核心依据,记为 。
其核心含义是 “在当前状态s下,智能体选择动作a的概率”。若为确定性策略,则在某一状态下仅对应一个确定动作(概率为 1,如 “红灯状态下必选停车动作”);若为随机性策略,则在某一状态下会以不同概率选择多个动作(如 “绿灯状态下 80% 概率匀速前进,20% 概率减速观察”)。
策略的本质是智能体的 “行为准则”,强化学习的核心目标就是通过与环境的交互,不断优化策略,最终找到能最大化长期累积奖励(Return)的最优策略
。
二. 马尔科夫决策过程(MDP)
理解了基本概念后,我们需要一个严谨的数学框架来描述智能体与环境的交互过程,而马尔科夫决策过程(Markov Decision Process,MDP)就是这个 “骨架”。马尔科夫决策过程是描述随机动态系统的一般框架,它并不局限于强化学习,而是强化学习依赖于这个框架。
几乎所有经典的强化学习问题,都可以建模成 MDP 问题。MDP 通过量化“状态、动作、奖励、转移概率”,为强化学习提供了“智能体 - 环境交互”的数学建模工具,让“最大化长期累积奖励”的目标可通过算法计算与优化实现。
1. 马尔科夫性(Markov Property)
马尔科夫性指的是随机过程中的无记忆性,它在数学上表示为:
其中 表示当前时刻,
表示下一时刻。上式表示下一个状态和奖励仅依赖于当前时刻的状态和动作,与之前时刻的状态和动作无关。
2. 关键要素(S、A、P、R、γ)
马尔科夫决策过程是描述随机动态系统的一般框架,它并不局限于强化学习,而是强化学习依赖于这个框架。MDP 由状态空间(S)、动作空间(A)、状态转移概率(P)、奖励函数(R)、折扣因子(γ)五要素构成。
状态空间(State Space,S)
-
定义:所有可能环境状态的集合,记为S。每个状态s ∈ S都包含智能体决策所需的关键信息,且满足 “马尔科夫性”(未来状态仅依赖当前状态)。
-
实例:在 “迷宫逃生” 任务中,状态空间S是 “迷宫中所有格子的位置”(如S = {格子(1,1), 格子(1,2), ..., 格子(5,5), 出口});在自动驾驶场景中,S是 “车速、与前车距离、红绿灯状态” 等参数的所有组合(如
)。
-
核心作用:明确当前所处的环境状态,为智能体提供 “决策依据”。
动作空间(Action Space,A)
-
定义:智能体在任意状态下可执行的所有操作的集合。动作的选择会直接影响环境状态的转移。
-
实例:在 “围棋游戏” 中,动作空间A是 “棋盘上所有可落子的交叉点”(离散型,共 19×19=361 个动作);在 “机器人机械臂控制” 中,A是 “机械臂关节的旋转角度范围”(连续型,如 “0°-180° 的任意角度”)。
-
核心作用:连接状态与状态转移的桥梁,定义智能体的 “决策范围”,即智能体“能做什么”。
状态转移概率(Transition Probability,P)
-
定义:表示智能体在状态s下执行动作a后,转移到新状态s'的概率,记为
。它是环境 “随机性” 的数学表达 —— 即使在相同状态执行相同动作,环境也可能因噪声、干扰等因素转移到不同状态。
-
实例:在 “机器人抓取零件” 任务中,若智能体在状态s(零件在机械臂正下方)执行动作a(抓取),因零件表面光滑,有 90% 概率成功抓取(转移到
:机械臂持有零件),10% 概率抓取失败(转移到
:零件掉落),此时
,
。
-
核心作用:让智能体可预测动作的潜在结果,为策略优化提供概率依据。
奖励函数(Reward Function,R)
-
定义:环境对智能体 “动作效果” 的反馈信号,记为R(s, a, s')(或简化为R(s, a)),表示在状态s执行动作a并转移到s'后获得的奖励值(可正、可负、可零)。它是引导智能体学习方向的 “指挥棒”。
-
实例:在 “迷宫逃生” 中,奖励函数设计为:若从状态s执行动作a后到达出口(s'=出口),则R(s, a, s')=100(高额正奖励,鼓励目标行为);若撞到墙壁(s'=墙壁),则R(s, a, s')=-10(负奖励,规避错误行为)。
-
核心作用:定义 “好坏标准”,让智能体明确 “哪些动作值得做”,是累积奖励最大化目标的核心依据。
折扣因子(Discount Factor,γ)
-
定义:介于 0 到 1 之间的常数(0 ≤ γ ≤ 1),用于衡量 “未来奖励” 的权重。γ越接近 1,智能体越重视长期奖励;γ越接近 0,越关注即时奖励。
-
实例:在 “围棋游戏” 中,γ通常设为 0.99—— 因为围棋需要长期布局,一步的短期收益(如吃一子)远不如最终获胜(长期高额奖励)重要;而在 “即时避障” 任务中,γ可设为 0.1—— 智能体需优先保证当前时刻不碰撞(即时奖励),远期安全可暂不考虑。
-
核心作用:平衡 “短期收益与长期收益”,同时避免无限期任务中累积奖励趋于无穷大,确保目标函数可计算、可收敛。
3. 轨迹(Trajectory)、回报(Return)、回合(Episode)
轨迹:智能体与环境在一段时间内交互过程的完整记录
轨迹的核心构成:MDP 核心要素(S, A, R)的时间序列组合。其典型形式为:
其中每个单元都是MDP中“状态转移”的一次具体实现。
整个轨迹覆盖了从状态 开始,到终止状态
结束的完整交互过程,其中t是交互的总时间步(若为无期限任务,
)。在回合制任务(如迷宫逃生、游戏关卡)中,一条轨迹恰好对应一个回合的完整交互过程 —— 回合从初始状态
开始生成轨迹,到终止状态
结束时,轨迹也随之完成,二者在时间范围上完全一致。
轨迹的作用:智能体通过与环境交互生成大量轨迹,这些轨迹中包含的 “s-t-a-r” 数据,是无模型强化学习(如 Q-Learning、SAC)更新策略的唯一依据;同时,回报(Return)也是 “基于轨迹中特定时间步后的奖励序列计算的”。
回报(Return):MDP 的核心目标量化指标
沿着一条轨迹,智能体会得到一系列的即时奖励,这些即时奖励之和被称为回报(或累积奖励)。
回报是基于 “奖励函数(R)” 和 “折扣因子(γ)” 计算得出的核心目标值,其公式为:
输入:由奖励函数(R)生成的即时奖励(r)。
权重:由折扣因子(γ)决定 —— 平衡短期与长期奖励。
输出:量化 “从 t 时刻开始的长期累积收益”。
回报的本质是 “策略(π)价值的量化体现”—— 同一状态下,不同策略会产生不同的回报,智能体的学习过程就是 “寻找能最大化期望回报()的最优策略(
)”。
不同强化学习算法通过不同方式利用回报优化策略:例如 Q-Learning 通过学习“状态 - 动作价值函数 Q (s,a)”间接逼近回报;策略梯度算法则直接对‘回报期望’求导,调整策略参数以提升长期收益。
回合(Episode):有终止状态的完整交互周期
回合:当执行一个策略进而与环境交互时,智能体从初始状态到终止状态停止的过程被称为一个回合(episode)或者尝试(trial)。
一个回合包含多个时间步(Time Step),每个时间步对应一次的单次交互,回合的终止意味着该次交互周期的结束,下一个回合将从新的初始状态开始新的时间步序列。
更多推荐
所有评论(0)