奖励塑形是强化学习中一种通过改写或补充奖励函数来引导智能体学习的技术。它在环境原有奖励之外加入辅助的塑形奖励,让智能体在两者合成后的奖励下训练,以缓解奖励稀疏、反馈延迟造成的学习困难,并加快策略收敛[1][2]。1999 年 Ng、Harada 与 Russell 给出基于势函数的塑形形式,并证明该形式下最优策略不变,这一结论成为此后研究的理论基础[3]。
定义
奖励塑形指的是在环境给定的原始奖励之外,再向智能体提供一份补充奖励,使其按照二者相加得到的新奖励函数来更新策略[1]。若以 $R(s,a,s')$ 记环境奖励、$F(s,a,s')$ 记塑形项,则合成奖励写作 $R'(s,a,s')=R(s,a,s')+F(s,a,s')$[1]。这类做法主要针对两种困难:任务只在终点或极少数时刻给出反馈,奖励信号过于稀疏;以及需要把领域知识或人的偏好注入学习过程[2][4]。
在术语体系中,奖励塑形常与奖励工程并列提及:奖励工程侧重设计能准确反映目标的奖励函数,奖励塑形则侧重在原有奖励之上追加引导性反馈,从而加速收敛到较优策略[2]。奖励塑形既可以由人手工设计,也可以由算法自动生成,后者是近年的主要研究方向[5]。
原理
最常见且有理论保证的构造方式是基于势函数的奖励塑形(potential-based reward shaping,PBRS)。它先在状态上定义势函数 $\Phi$,再取转移前后折扣势函数之差作为塑形项:$F(s,s')=\gamma\Phi(s')-\Phi(s)$,其中 $\gamma$ 是折扣因子[6][5]。势函数可以理解为给状态空间铺了一张地形图,塑形奖励就是在图上移动时的高度变化[7]。
这种形式的特殊之处在于不改变原问题的最优策略。在马尔可夫决策过程中沿一条完整轨迹累加各步塑形项,中间状态的势函数值会成对抵消,只剩首末之差,于是任意策略的价值函数整体减去一个与动作无关的量,状态之间、动作之间的优劣次序保持不变[6]。Ng 等证明,除正线性变换外,这种基于势函数的加性变换是唯一能普遍保持最优策略集合的奖励变换[3][8]。若把势函数取为最优状态价值函数,价值迭代只需一步就能得到解,可见塑形的实质是把远期好坏的信息提前摊到每一步[6]。
以塑形奖励参与训练的数据流可简示如下:
flowchart LR
A[环境原始奖励 R] --> C[合成奖励 R']
B[塑形项 F,由势函数 Φ 计算] --> C
C --> D[智能体更新策略]
发展历程
1999 年之前,通过改造奖励来改善学习已在若干任务中被尝试,例如 1997 年前后的相关研究,以及 1998 年把塑形奖励用于自行车驾驶控制的工作。1999 年,Ng、Harada 与 Russell 将这一做法形式化:他们证明在马尔可夫决策过程中,除了正线性变换,还可以叠加一个能写成任意势函数差值的转移奖励而不改变最优策略,并给出基于距离和子目标的势函数构造办法,实验中学习时间明显缩短[3]。
同一项工作还解释了以往塑形实践中的若干错误来源:当塑形项无法写成势函数之差时,智能体可能收敛到在塑形奖励下最优、但相对原任务并非最优的策略[9][7]。后续分析进一步把这一条件收紧,认为基于势函数是保证策略不变的充分必要条件[10]。
2003 年,Wiewiora 证明基于势函数的塑形与按势函数初始化 Q 值在学习更新上等价,并证明在相当广的一类策略下两者的行为无法区分[7]。2012 年,Devlin 与 Kudenko 把该方法扩展到动态情形,允许势函数在学习过程中变化而仍保持策略不变性,并把结论延伸到多智能体的均衡性质[11]。
由于人工设计势函数依赖领域知识,近年研究转向自动获取塑形信号,例如用元学习训练势函数网络,或用双层优化让算法自行决定采纳多少塑形奖励[5][4]。也有工作把内在动机一类探索信号改写成不改变最优策略的塑形形式,并针对长回合、极稀疏环境提出允许塑形项依赖动作的方法,在《蒙特祖玛的复仇》等任务上检验[12]。
应用
移动机器人导航是常见应用场景。针对端到端导航中奖励稀疏、难以稳定收敛的问题,有研究以激光扫描的碰撞熵作为动态塑形项度量环境不确定性,并用成功率变化斜率自适应调整塑形系数,仿真中密集环境下的成功率提高到 84.5%,碰撞率降到 14.5%[13]。
在连续控制与游戏基准上,塑形主要用于加快收敛。有研究直接以智能体当前的状态价值估计充当势函数,在 Atari 游戏套件上缩短了训练时间[14];也有工作用新旧策略的优势值差异构造塑形项,在 MuJoCo 的多关节控制任务中检验样本效率[15]。
在人机交互式教学中,塑形奖励可以由人的反馈生成。TAMER 框架先把人的评价性反馈转为奖励并拟合回归模型,再按带衰减权重的形式与环境奖励相加,用于训练机器人等智能体[16]。在对话系统里,由于奖励通常只在对话结束时给出,研究者用循环神经网络从标注数据中生成附加奖励;在实时广告竞价等只反馈成功与否的任务中,也有把奖励区间细分以形成更丰富信号的做法[5]。
局限
当塑形奖励与真实目标不一致时,智能体可能转而优化塑形项而牺牲原任务,即奖励黑客,用内在动机构造的复杂塑形在长回合、探索量大的环境中尤其容易退化,一些保持最优性的既有方案在《蒙特祖玛的复仇》这类极稀疏任务上并不适用[12]。
基于势函数的塑形虽然保证最优策略不变,但势函数本身通常要靠领域知识人工设计,设计不当会限制探索或把智能体引向特定方向[1][15]。把人的知识转成数值奖励也难以做到完全准确,因此完全采纳给定的塑形奖励未必提高算法表现,算法需要自行判断哪些塑形项有益[4]。
另有分析指出,塑形的实际效果取决于初始 Q 值与外部奖励的取值,形状相同而整体平移的势函数会带来不同的引导强度,因此即使保留势函数所表达偏好,也需要额外调整才能奏效[17]。在有限回合且存在多个终止状态的任务中,如果终止状态的势函数值不为零,策略不变性会被破坏[5]。塑形方法通常还带有需要在训练前设定的超参数,其取值显著影响最终收益,调参过程耗时[5]。
在离线多智能体强化学习中,密集的内在奖励可能改变底层的马尔可夫博弈,而借助世界模型给出的引导又会放大模型偏差,因此塑形在这类场景下的可靠性仍受质疑[18]。
参见
参考资料
- keywords . ieee.org [引用日期2026-09-29]
- huggingface.co 上的网页 . huggingface.co [引用日期2026-09-29]
- mendeley.com 上的网页 . mendeley.com [引用日期2026-09-29]
- b710915795b9e9c02cf10d6d2bdb688c-Abstract . neurips.com.cn [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Reward Shaping . berkeley.edu [引用日期2026-09-29]
- jair.org 上的文件 . jair.org [引用日期2026-09-29]
- Calculus on MDPs: Potential Shaping as a Gradient . arxiv.org [引用日期2026-09-29]
- semanticscholar.org 上的网页 . semanticscholar.org [引用日期2026-09-29]
- Reward Shaping in Episodic Reinforcement Learning . kent.ac.uk [引用日期2026-09-29]
- semanticscholar.org 上的网页 . semanticscholar.org [引用日期2026-09-29]
- Action-Dependent Optimality-Preserving Reward Shaping . icml.cc [引用日期2026-09-29]
- 融合课程学习与自适应奖励塑形的移动机器人导航方法 . arocmag.cn [引用日期2026-09-29]
- Bootstrapped Reward Shaping . iaifi.org [引用日期2026-09-29]
- S0952197625006761 . sciencedirect.com [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- icml.cc 上的网页 . icml.cc [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:48:26Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。