强化学习(Reinforcement Learning,简称 RL)是机器学习中面向序贯决策的一个分支,研究智能体如何在与环境反复交互的过程中挑选动作,以让长期累积的回报尽可能大[1]。它与监督学习、无监督学习同属机器学习的三大基本范式,训练数据随交互过程逐步产生,而不是事先准备好的一批标注样本[2][3]。它适合处理需要多步规划和长期权衡的决策问题,已在游戏、机器人控制、自动驾驶和大语言模型对齐等方向得到应用[4]。
定义
强化学习研究的是通过试错改进决策的一类学习问题:智能体对环境施加动作之后会得到一个数值形式的奖励,并据此调整往后的动作选择,使整个过程中的累积奖励尽量大[2][4]。
在机器学习的三种主要范式中,监督学习依靠带标签的静态数据,无监督学习从没有标签的数据里寻找结构,强化学习则没有事先给定的标注样本,数据随着交互逐步生成[3][4]。正因如此,它主要处理序贯决策问题,当前的选择会影响之后所能观察到的状态与结果[1]。
这类问题通常用马尔可夫决策过程来刻画,其中包含状态、动作、奖励以及状态转移等要素,其思想来自动力系统理论[4]。策略是从状态到动作的映射,最优策略指的是在每个状态下都能取得最大长期回报的那个函数[3][5]。
原理
在一个马尔可夫决策过程中,时间被切分为若干步骤。每一步智能体先观察环境处于什么状态,选出一个动作,环境随之给出奖励并转移到新的状态,直到抵达终止状态,这一段过程称为一个回合[4]。
强化学习用价值函数衡量某个状态或状态—动作组合的长期收益,贝尔曼方程则把这一长期量拆解为即时奖励与后继价值的估计,动态规划、蒙特卡洛方法和时序差分学习构成了三类基本的计算路径[1]。蒙特卡洛方法要等回合结束后用实际回报来修正估计,时序差分方法则不必等到回合结束,它用当前奖励加上对后继价值的预测构成更新目标[1]。
在基于价值的方法里,Q学习直接学习状态—动作对的价值,其更新式可写为 $Q(s,a) ← Q(s,a) + α(r + γ·max Q(s′,a′) − Q(s,a))$,其中 α 是学习率,γ 是折扣因子[6]。它允许用与当前目标策略不同的行为策略所采集的数据进行学习,因此属于离策略方法[1]。
flowchart LR
A[智能体] -->|动作| B[环境]
B -->|状态与奖励| A
训练过程中要权衡探索与利用:只挑目前看起来最好的动作,可能错过更优的选择,常用做法是以一定概率随机行动,其余时候选择当前估值最高的动作[6]。当状态空间大到无法用表格存储时,可以用神经网络近似价值函数或策略,这类做法称为深度强化学习[5][1]。
发展历程
强化学习这一名称在20世纪60年代就已出现在工程文献中,它的形成与心理学里关于动物学习的研究、以及最优控制理论这两条线索有关[7]。1957年贝尔曼提出动态规划,并给出最优控制问题的随机离散版本,即马尔可夫决策过程;1960年霍华德提出策略迭代方法,这些工作后来成为强化学习的理论基础[7]。
1959年,塞缪尔(Arthur Samuel)在跳棋程序中使用了与时序差分相近的机制[2][3]。1988年萨顿(Richard Sutton)系统提出并分析了时序差分学习,1989年沃特金斯(Chris Watkins)提出Q学习,把时序差分思想与最优控制的问题框架结合起来[7][8]。20世纪80年代出现的行动者—评论者结构,把负责选择动作的部分与学习价值预测的部分组合在一起,评论者产生的误差成为行动者调整策略的依据[1]。
20世纪90年代,TD-Gammon 通过自我对弈生成棋局,并用时序差分训练神经网络评估局面,显示出价值学习可以在没有逐步专家标注的情况下形成复杂策略[1]。2013年与2015年,DeepMind 提出深度Q网络,用卷积神经网络直接从游戏画面学习动作价值,并借助经验回放与目标网络稳定训练,在49款雅达利2600游戏中用同一套架构进行学习[1][8]。
2016年3月,把深度神经网络与蒙特卡洛树搜索结合的AlphaGo与韩国棋手李世石进行五局对局,并以4比1取胜[2][9]。此后同一技术路线经由自我对弈扩展到国际象棋、将棋和围棋,达到了较高水平[1]。
2017年前后出现了利用人类偏好训练奖励模型、再用强化学习优化策略的做法;2022年发表的指令微调系统先用人类示范做监督微调,再按回答排序训练奖励模型,最后用近端策略优化更新语言模型,这一流程一般称为基于人类反馈的强化学习[1]。
应用
强化学习适用于规模较大、结构复杂的决策问题,例如供应链管理、暖通空调系统、工业机器人、游戏人工智能、对话系统和自动驾驶[4]。棋类与电子游戏规则清晰、可以快速大量模拟,因此成为强化学习较早取得成果的领域[10]。
在机器人领域,策略往往先在仿真环境中训练,再迁移到真实设备上执行,但仿真与现实的差异会削弱迁移效果[11]。
在大语言模型的训练中,强化学习用于让输出更贴近人类偏好:先由标注者对模型的不同回答排序,据此训练奖励模型,再用策略优化算法更新生成策略[12][13]。
强化学习还可用于优化不容易求导的目标,例如代码的执行速度、检测或翻译任务的评价指标,以及生成内容所获得的人类偏好评分[14]。
局限
强化学习通常需要与环境进行大量交互才能得到可用的策略,样本效率偏低;在真实系统中反复试错成本高,有时还会带来安全风险,因此许多成功案例依赖仿真环境[14][15]。
当价值函数或策略由神经网络近似时,自举、离策略学习与函数逼近三者叠加可能造成训练不稳定,算法表现对超参数和随机种子也较为敏感,算法之间的比较需要谨慎的统计评估[14][1]。
智能体在训练环境之外的泛化能力往往下降,仿真到现实的迁移仍是难点[15]。奖励函数设计不当还可能被智能体利用,它可能找到与设计意图不符、却能获得高分的取巧做法[14]。
在只能使用预先收集的离线数据时,策略容易对数据分布之外的动作给出过于乐观的估值,从而影响性能;在医疗、自动驾驶等高风险或资源受限的场景中,在线探索往往不可行[1][16]。
在基于人类反馈的训练流程中,奖励模型可能学到标注数据里的偏见或表面特征,训练本身也存在不稳定和难以调参的问题,这些都会影响最终行为[13]。
参见
参考资料
- 强化学习 . wikipedia.org [引用日期2026-09-29]
- CCCF详情 . ccf.org.cn [引用日期2026-09-29]
- 迄今为止, 强化学习和最优控制仍然使用不同的术语和符号表示方法 . tup.com.cn [引用日期2026-09-29]
- Use Reinforcement Learning with Amazon SageMaker . amazon.com [引用日期2026-09-29]
- 探索自主智能技术 . microsoft.com [引用日期2026-09-29]
- reinforcement_learning . mit.edu [引用日期2026-09-29]
- tsinghua.edu.cn 上的 PDF 文件 . tsinghua.edu.cn [引用日期2026-09-29]
- 紧密联系到最优控制问题的是时序差分学习,其显著特点在于依赖于对同一量在时序上的连续估计 . siat.ac.cn [引用日期2026-09-29]
- Alpha Go の技術と対戦 . jst.go.jp [引用日期2026-09-29]
- nottingham.edu.cn 上的 PDF 文件 . nottingham.edu.cn [引用日期2026-09-29]
- ijcai.org 上的网页 . ijcai.org [引用日期2026-09-29]
- realpython.com 上的网页 . realpython.com [引用日期2026-09-29]
- 8.2_rlhf . github.com [引用日期2026-09-29]
- An Invitation to Deep Reinforcement Learning . arxiv.org [引用日期2026-09-29]
- ieee.org 上的 PDF 文件 . ieee.org [引用日期2026-09-29]
- ieee.org 上的网页 . ieee.org [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:44:20Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。