偶然不确定性(Aleatoric uncertainty)是机器学习中刻画数据自身固有随机性的一类不确定性,又称统计不确定性或数据不确定性,它来自数据生成过程的随机成分,无法依靠增加数据量消除。[1] 它与源于知识不足的认知不确定性共同构成预测不确定性的两个主要来源,区分二者对安全攸关场景下的可靠性评估与决策具有意义。[2]
定义
偶然不确定性指观测数据里固有的噪声与变异,其来源是数据生成过程本身的随机成分,例如传感器噪声、运动噪声或标注误差。[1] 抛硬币是常被引用的例子:即使模型完全正确,也只能给出两种结果的概率,无法预先断定某一次的结果。
与之相对的认知不确定性源于对潜在数据生成过程的认识不足,可以借助更多数据或更合适的模型减轻;因此偶然不确定性被视为总不确定性中不可约减的部分,认知不确定性则是可约减的部分。[3]
这一名称中的 aleatoric 出自拉丁语中表示骰子的词,用来强调其统计或随机性质。[4] 在不同学科传统中,同类不确定性也被称作变异、随机不确定性或数据不确定性。[4]
原理
在回归问题中,预测方差常借助全方差定律拆成两项:$Var(y)=\mathbb{E}_{\theta}[Var(y|x,\theta)]+Var_{\theta}(\mathbb{E}[y|x,\theta])$,前一项对应偶然不确定性,后一项对应认知不确定性。[5][6]
在分类问题中,总不确定性由预测分布的熵衡量;对模型参数取条件熵得到偶然不确定性,参数与结果之间的互信息对应认知不确定性,二者相加等于总不确定性。[6][7]
建模时通常给模型输出施加一个分布,并让网络直接预测观测噪声。若假定噪声强度对所有输入相同,称为同方差;若允许噪声随输入变化,则称为异方差。[1] 常用的高斯负对数似然损失可写作 $L=\frac{1}{2\sigma^{2}}\|y-f(x)\|^{2}+\frac{1}{2}\log\sigma^{2}$,实际训练中多改为预测对数方差以保证数值稳定。[1][8]
由于噪声方差出现在损失的分母上,噪声较大的样本对参数更新的影响会被自动压低,这种效果被称为损失衰减。[9]
发展历程
把不确定性分为两类的思路早于机器学习:1921 年奈特把可度量的风险与不可度量的不确定性分开,1975 年哈金进一步区分偶然概率与认知概率。[4] 此后在风险分析与可靠性工程中,随机变异与知识缺乏的二分被广泛沿用。[10]
相关综述指出,在机器学习语境下,Senge 等人于 2014 年最先明确提出区分这两类不确定性,并将其量化方法用于医疗决策场景。[11]
2017 年,Kendall 与 Gal 在面向计算机视觉的贝叶斯深度学习工作中系统讨论了两者的差别,提出让网络学习与输入相关的异方差偶然不确定性,并与认知不确定性组合进同一框架;该工作发表在当年的神经信息处理系统大会。[9][12]
2021 年,Hüllermeier 与 Waegeman 发表综述,梳理了不确定性的一般概念与处理手段,刊登于《Machine Learning》第 110 卷第 3 期,成为该主题被广泛引用的参考资料。[2]
2025 年,机器学习国际会议上有研究提出偶然与认知的二分不足以刻画研究者所关心的多种量,并尝试用决策论框架重新表述预测不确定性、预测表现与数据离散程度之间的关系。[13]
应用
在计算机视觉中,逐像素的深度回归与语义分割常被用来展示偶然不确定性的建模:模型在物体边界或距相机较远的位置给出更高的偶然不确定性,而语义与外观上困难的区域更多表现为认知不确定性。[9]
在医学影像与临床决策支持等场景中,概率预测的可靠性需要区分随机变异与知识欠缺;图像分类中外观相似但类别不同的对象(如某些犬类与狼)会因特征混淆带来较高的偶然不确定性。[14] 也有方法把预测不确定性拆成两部分,用于从无标注数据中挑选样本交由专家标注。
在联邦学习中,由于偶然不确定性在训练过程中相对稳定且不可约减,它被用作衡量各客户端数据质量与“劣势”程度的权重,以避免只按数据量分配重要性。[7]
在地球科学与遥感中,卫星观测的仪器噪声属于偶然不确定性,而与参数和模型结构有关的偏差属于认知不确定性,区分两者有助于在数据同化中合理融合观测与模型结果。[15]
在材料科学中,人们用概率神经网络为纤维增强复合材料微观结构建模,重点量化随输入条件变化的异方差偶然不确定性。[16]
局限
只建模偶然不确定性存在明显短板:来自数据分布之外的样本可以被认知不确定性识别,仅靠偶然不确定性则难以判断。[9]
两类不确定性的划分并非绝对,它依赖于输入空间、假设空间与数据分布的设定;把数据映射到更高维空间可能降低偶然不确定性,同时使模型更难拟合而抬高认知不确定性。[17]
在实际问题中,判断数据生成过程究竟完全随机还是仅仅非常复杂往往很困难;常用的条件熵与互信息等指标也可能偏离它们声称度量的对象。[6][13]
此外,观测噪声原则上可以通过改进测量手段降低,因此在给定数据集下被视为不可约减的偶然不确定性会随数据采集方式而变;在贝叶斯分类中,标准似然也难以直接表达对偶然不确定性的假设。[18]
参见
参考资料
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- mtmt.hu 上的网页 . mtmt.hu [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Revised_Manuscript_Unmarked(PDF) . ucl.ac.uk [引用日期2026-09-29]
- 贝叶斯深度学习 | Bohrium . bohrium.com [引用日期2026-09-29]
- tutorialECMLPKDD2021(PDF) . ugent.be [引用日期2026-09-29]
- authors . ieee.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- CNR Institutional Research Information System . cnr.it [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- Rethinking Aleatoric and Epistemic Uncertainty . icml.cc [引用日期2026-09-29]
- Appendix A Uncertainty Quantification . thecvf.com [引用日期2026-09-29]
- s10712-025-09919-2(PDF) . springer.com [引用日期2026-09-29]
- references . ieee.org [引用日期2026-09-29]
- 近い近似ができているかという不確かさとして評価さ . aist.go.jp [引用日期2026-09-29]
- xml . nsf.gov [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:48:04Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。