认知不确定性是机器学习中的一类不确定性,指模型因掌握的知识不足而产生的、原则上可以随信息增加而降低的不确定性,也称为模型不确定性[1]。它不同于源于数据本身随机性的偶然不确定性,二者的区分已成为机器学习不确定性研究的基础之一,并应用于主动学习、分布外检测与安全关键系统[2]。对它的度量通常借助参数后验、预测方差或互信息,估计手段包括蒙特卡洛 dropout 与深度集成等[3]。
定义
认知不确定性指模型由于知识不足而产生的不确定性,其来源包括训练数据有限、输入空间中样本稀疏以及模型假设不完善等[2]。它刻画的是模型对真实数据生成过程认识上的欠缺,而非该过程自身固有的随机性[4]。在深度学习中,由于神经网络的拟合能力很强,与模型选择有关的那部分不确定性常被视为可以忽略,认知不确定性一般被理解为与模型参数相关的不确定性[5]。
机器学习中的不确定性通常被划为认知不确定性与偶然不确定性两类[3]。偶然不确定性来自数据生成过程中的固有随机效应,掷硬币是典型例子;认知不确定性则由决策者知识状态的不完整引起,例如医生在缺少检查结果时无法确定诊断[6]。区分二者的一个常用判据是:这种不确定性是否会随额外信息的获得而减小[7]。
原理
在贝叶斯框架下,预测结果由参数后验分布对似然加权平均得到,$p(y\mid x,D)=\int p(y\mid x,\theta)\,p(\theta\mid D)\,\mathrm{d}\theta$,其中参数后验的宽窄体现了模型掌握知识的多少[5]。总不确定性可分解为两部分:给定参数时预测自身的波动构成偶然不确定性,而不同参数所给期望之间的差异构成认知不确定性[5]。
在分类任务中,预测分布的熵常被用作总不确定性的度量,认知不确定性则可用互信息表示,它衡量在观测到输出之后关于模型参数的不确定性可以减少多少[8]。实际计算时,一般用多组参数或模型对同一输入分别预测,再以这些预测之间的分歧近似认知不确定性[2]。
获得参数后验近似的常见途径有蒙特卡洛 dropout、深度集成、贝叶斯反向传播与拉普拉斯近似等[5]。蒙特卡洛 dropout 在推理阶段保留随机丢弃操作并多次前向计算,深度集成则训练多个初始化不同的网络并对输出做汇总[5]。深度集成在已知分布与未知分布的测试样本上都给出经过校准的预测不确定性,并对分布外样本表现出更高的不确定性[9]。此外也存在确定性思路,例如在特征空间中学习类别中心,用样本到中心的距离作为不确定性度量,以避免多次前向传播带来的开销[5]。
发展历程
认知不确定性与偶然不确定性的区分可追溯到统计学与风险分析领域,在机器学习中被明确提出则相对较晚;按照相关综述的记述,Senge 等人 2014 年的工作被认为最早在机器学习语境下论证了作出这一区分的必要性[10]。
2016 年,Gal 与 Ghahramani 提出将 dropout 视为贝叶斯近似,用以在深度学习中表示模型不确定性[11]。2017 年,Kendall 与 Gal 讨论了面向计算机视觉的贝叶斯深度学习需要哪些不确定性,把偶然不确定性与认知不确定性分开处理[12];同年,Lakshminarayanan 等人提出深度集成,作为一种实现简便、便于并行、需要调整的超参数较少的预测不确定性估计方法[13]。
2021 年,Hüllermeier 与 Waegeman 在期刊《Machine Learning》上发表综述,系统介绍了机器学习中的不确定性概念与方法,并梳理了区分两类不确定性的各种形式化尝试[3]。
应用
在主动学习中,挑选认知不确定性较高的样本加以标注,被认为比优先处理偶然不确定性高的样本更有助于提升模型的泛化能力[2]。
在分布外检测与分布偏移监测中,模型对远离训练分布的输入应当给出更高的认知不确定性,据此可以判断部署阶段的数据是否偏离原有分布[2]。
在安全关键场景中,人们更关注总不确定性的大小:当估计值较高时,系统可以拒绝给出预测或把控制权交还人类,自动驾驶中的触发告警即属此类做法[2]。相关的不确定性量化技术也被用于计算机视觉与自然语言处理等任务[5]。欧洲曾设立以认知不确定性为主题的研究项目,以推进可信人工智能方向的不确定性量化研究[5]。
局限
认知不确定性与偶然不确定性并非绝对概念,二者的划分依赖于对输入空间、假设空间等设定所作的选择;一旦允许改变数据表示,两类不确定性的量化就变得更加困难[7]。例如把数据嵌入更高维空间可以降低偶然不确定性,但同时会使模型更难拟合、需要更多数据,因而推高认知不确定性[2]。
以多模型分歧作为认知不确定性的代理只是一种近似,当偶然不确定性较高,或相关模型集合上的分布与全体模型上的分布差异明显时,这种近似可能失效[14]。
两类不确定性在实际问题中往往难以彻底分开,在某些应用场景下作出区分也并非必要[2]。此外,假定模型被正确选择等于忽略了模型误选的风险;若模型设定本身有误,增加数据只能消除近似层面的不确定性,而无法纠正模型选择上的偏差[7]。
参见
参考资料
- google.com 上的网页 . google.com [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- mtmt.hu 上的网页 . mtmt.hu [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Tesi_dottorato_Ledda(PDF) . depositolegale.it [引用日期2026-09-29]
- S0020025513005410 . sciencedirect.com [引用日期2026-09-29]
- 近い近似ができているかという不確かさとして評価さ . aist.go.jp [引用日期2026-09-29]
- authors . ieee.org [引用日期2026-09-29]
- 9ef2ed4b7fd2c810847ffa5fa85bce38-Abstract . neurips.com.cn [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:47:52Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。