Intrinsic Interpretability(内在可解释性)是机器学习可解释性研究中的一类方法,指在建模阶段就把可解释性写入模型自身结构,使模型成为能够自我解释的白箱,而无须再借助外部解释工具[1][2]。与之相对的是事后可解释性(post-hoc),即先训练出黑箱模型,再另建一个模型去解释它[3]。决策树、线性模型、基于规则的模型等是常见的内在可解释模型[2]。在医疗、信贷、刑事司法等高风险决策场合,模型能否被使用者看懂并审查十分关键[4]。
定义
内在可解释性指把可解释性直接嵌入模型结构,使训练完成的模型本身即可被理解和审查[1]。它与事后可解释性并列为机器学习可解释性研究的两大范式,区别在于可解释性在什么时候获得[3][2]。
已有文献也把这类做法称为事前可解释(ante-hoc)或透明解释,共同点是利用模型自身的性质推导解释,而不从外部探测模型[5]。与之相对的事后可解释性需要另建一个模型来解释已有模型[1]。按覆盖范围划分,内在可解释性又分全局与局部两类:前者说明模型整体如何运作,后者解释单次预测的来由[1]。
原理
内在可解释模型主要依靠几类数学性质保持透明,包括线性、单调性与特征之间的交互作用[6]。线性指输出是输入特征的线性组合,单调性指某个输入增大时输出只朝一个方向变化,交互作用描述一个特征的效果随另一个特征取值而改变[6]。
最典型的例子是线性回归,每个特征的系数固定,输入每变化一个单位对预测的影响可以直接读出;决策树则把预测过程拆成一系列条件判断,使用者可以沿分支追踪到结论[6]。不同模型在这三项性质上各有取舍:逻辑回归和朴素贝叶斯单调但不含交互项,RuleFit 含交互却不保证单调,k 近邻三项都不满足[6]。
另一条思路是把模型约束为可加形式,即预测值等于各特征贡献之和:$g(x)=\sum_j f_j(x_j)$。广义加性模型把每一项 $f_j$ 表示为一条形状函数曲线,使单个特征的影响方向与强弱可以直接观察;神经可加模型(Neural Additive Models)同样把预测限制为可加贡献,但用神经网络拟合这些形状函数[7]。
发展历程
对计算系统作出解释的做法可以追溯到基于规则的专家系统时期,这类系统把决策逻辑以规则形式显式写出[8]。在随后的可解释机器学习教材中,线性回归、逻辑回归、决策树等被归入可解释模型一章集中介绍[9]。
2016 年,Ribeiro 等人提出 LIME,做法是在待解释的预测点附近用稀疏线性模型近似黑箱模型的行为,成为事后解释方法的代表。此后几年间事后解释吸引了大量研究投入,成为可解释机器学习中研究最集中的方向之一[10]。
2018 年 11 月,辛西娅·鲁丁(Cynthia Rudin)提交论文《停止解释黑箱模型,改用内在可解释模型处理高风险决策》,该文于 2019 年 5 月发表在《自然·机器智能》[4]。文章主张与其为黑箱模型补做解释,不如从一开始就设计本身可解释的模型,并给出刑事司法、医疗和计算机视觉中的替代案例[4]。
这一主张源于鲁丁的工程经历:她曾与纽约电力公司的工程师合作,用机器学习评估地下电缆井的爆炸风险,发现不同方法的预测表现差别不大,而工程师能看懂并给出反馈的简单模型反而带来了关键改进[11]。她与合作者随后用拉肖蒙效应解释这种现象:数据中的噪声使许多模型的精度难以区分,于是可以在性能相近的一批模型中优先选择简单的[12]。
应用
内在可解释模型主要用于需要向当事人或监管方给出理由的高风险决策,例如医疗诊断、刑事司法与信贷审批[4]。以信贷评分为例,鲁丁等人证明可以只用少数几项指标构成评分卡,达到与黑箱模型相当的预测水平,同时让结果可以被直接审阅[12]。
在表格数据上,研究者发展出若干兼顾结构与解释的模型:TabNet 借助顺序注意力机制挑选特征,概念瓶颈模型(Concept Bottleneck Models)先预测人类可理解的概念、再由概念生成结果,基于原型的网络则用代表性样本解释判断[7]。这些设计被用于医疗与金融场景,用于提高解释的保真程度[7]。
在工程实现层面,InterpretML 等工具包把能力分为两类,一类直接提供内在透明的玻璃盒模型,另一类面向任意黑箱系统做解释[13]。在材料科学等自然科学中,可解释模型被用来把预测结果转化为可供实验检验的机理假设[10]。
局限
可解释性至今没有公认的定义与量化标准,如何比较一个全局可解释模型与一个局部可解释模型的解释能力,学界仍缺少共识[14]。这也使内在可解释性的评价缺少统一的度量方式[14]。
模型的透明程度会随特征维数增加而下降,当输入维度超出人的认知范围时,解释本身也会变得难以理解;随机森林、梯度提升和 XGBoost 等树集成模型通常被认为不可解读[15]。
内置结构并不自动等于有效解释。有研究指出,注意力权重、特征归因这类常被当作解释的产物,如果不能给出关于模型行为的可验证假设,就不构成完整意义上的解释[16]。该研究同时强调,模型可以内在可解释却是错的,解释是否正确与模型是否符合现实是两回事[16]。
可解释性与精度之间的关系也仍有争论。一种观点认为解释保真度与模型精度之间存在权衡,并把这一点视为两类方法的分界[3];另一种观点则以拉肖蒙效应为依据,认为在噪声较大的数据上这种权衡常常并不成立,简单模型可以达到同等精度[12]。
参见
参考资料
- s10796-021-10235-4 . springer.com [引用日期2026-09-29]
- 每日AI前沿术语:可解释机器学习(Explainable Artificial Intelligence, XAI) . baai.ac.cn [引用日期2026-09-29]
- Interpretable Machine Learning Techniques in AI . ieee.org [引用日期2026-09-29]
- las.ac.cn 上的网页 . las.ac.cn [引用日期2026-09-29]
- anu.edu.au 上的文件 . anu.edu.au [引用日期2026-09-29]
- Busi4720_NoCode(PDF) . evermann.ca [引用日期2026-09-29]
- keywords . ieee.org [引用日期2026-09-29]
- le2020aethra(PDF) . uni-magdeburg.de [引用日期2026-09-29]
- interpretable-ml-book-zh . github.com [引用日期2026-09-29]
- S2666-3864(23)00453-8 . cell.com [引用日期2026-09-29]
- People of ACM - Cynthia Rudin . acm.org [引用日期2026-09-29]
- informs.org 上的网页 . informs.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- Techniques for Interpretable Machine Learning . acm.org [引用日期2026-09-29]
- ACM: Digital Library: Communications of the ACM . acm.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:50:24Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。