一致性正则化是半监督学习中一类利用未标注数据的技术,其基本思想是:对同一样本施加不改变其语义的扰动后,模型给出的预测应当保持稳定、不出现明显变化。[1] 由于这一约束只依赖模型的输出、不需要真实标签,未标注数据可以直接参与训练,用于缓解标注数据不足的问题。[2] 它已成为深度学习时代半监督学习的主要思路之一,衍生出 Π 模型、时序集成、均值教师、虚拟对抗训练、无监督数据增强与 FixMatch 等一批算法。[3][4]
定义
给定一个未标注样本 $x$ 及其扰动版本 $\hat{x}$,一致性正则化在训练目标中加入一个不依赖标签的损失项,用距离函数 $d$ 衡量模型 $f_\theta$ 对两者的预测分布之差,并使该差异尽可能小:$d(f_\theta(x), f_\theta(\hat{x}))$。[3] 常用的距离度量包括均方误差、KL 散度和 JS 散度,也有工作直接采用交叉熵。[3][5] 该损失项可以与任意监督损失相加,因此既能用于半监督训练,也可以施加在有标注样本上以增强预测的稳定性。[2]
这一约束依据的是平滑性假设:输入空间中彼此接近的样本应当得到接近的输出,而对样本施加扰动并不改变它的类别。[6][7] 通过压制扰动所引起的预测波动,一致性约束会推动决策边界移向数据分布的低密度区域。[6] 在相关文献的分类中,它常与熵最小化和伪标签并列为半监督学习的三条主要技术路线。[8]
背景
深度模型的性能通常依赖大量人工标注样本,而标注工作成本高、耗时长;未标注数据获取容易,却无法直接参与监督损失的计算。[2] 早期的一种应对方式是用未标注数据预训练卷积神经网络的滤波器,再在少量标注数据上微调,这种做法主要着眼于缩短收敛所需的训练轮次,并没有把未标注数据写进训练目标。[9]
另一类工作借助随机数据增强、dropout 和随机池化提升泛化能力,但这些随机性在当时只被当作需要容忍的噪声,同一个训练样本多次通过网络会得到互不相同的预测。[2] 与此同时,基于图的传统半监督方法在自然图像等复杂数据上的性能与可扩展性都比较有限。[10]
内容
一致性正则化的训练目标通常由监督损失与一致性损失加权求和构成,权重在训练早期偏低、随训练推进逐步升高,使模型先依靠有标注数据学习标签信息,再逐渐吸收未标注数据提供的信息。[5] 各类算法的区别主要体现在扰动的构造方式和距离度量的选择上。[3]
Π 模型让同一个样本在同一轮训练中经过两次带 dropout 的随机前向传播,再最小化两个预测之间的均方误差;由于每个样本需要两次前向计算,其时间开销较高。[3][10] 时序集成改为保存历史预测,对每个样本在以往轮次上的预测做指数移动平均,再让当前预测与该平滑目标对齐,前向计算次数因此减半;但目标每个轮次只更新一次,在数据规模较大时不便使用。[11][3]
均值教师把平均的对象从预测改为模型权重:教师网络的参数是学生网络参数的指数移动平均,学生在带噪输入上的预测被要求与教师给出的目标一致。[11] 该方法在 SVHN 数据集上仅使用 250 个标签时取得 4.35% 的错误率,优于时序集成使用 1000 个标签时的结果。[11][12]
虚拟对抗训练沿使预测变化最大的方向对输入施加扰动,再最小化原始样本与受扰样本预测分布之间的 KL 散度,因而无需依赖与数据类型相关的语义保持变换。[13][3] 无监督数据增强同样以一致性正则化为核心,用 KL 散度计算未标注数据的损失,并配合训练信号退火与基于置信度的掩码。[14]
FixMatch把一致性正则化与伪标签结合起来:先对弱增强的未标注图像取预测,仅当最高类别置信度超过固定阈值时才转成伪标签,随后要求同一图像强增强版本的预测与该伪标签一致。[15][16] 在 CIFAR-10 上,该方法使用 250 个标签时准确率为 94.93%,使用 40 个标签(每类 4 个)时为 88.61%。[15]
影响与争议
FixMatch 之后,一致性正则化与伪标签的组合成为半监督图像分类中广泛采用的范式。[1] 这一思路还被推广到同时考虑语义相似度与实例级相似度的方向,例如 SimMatch 及其后续版本。[4]
质疑主要针对固定的置信度阈值:它没有考虑各类别学习难度的差异,较简单的类别会获得更多伪标签,从而形成类间偏差;同时模型在训练初期置信度偏低、后期几乎对所有样本都给出高置信度,容易累积错误并削弱泛化能力。[1] 针对这些不足,后续出现了按类别自适应调整阈值的 FlexMatch 与 FreeMatch、采用动态阈值的 Dash,以及借助历史预测估计置信度的 MarginMatch 等方法。[1][17]
在类别分布不均衡的实际数据上,这类方法更容易把未标注样本判给样本数量较多的类别,因此有研究认为使用类别分布假设时应当格外谨慎。[18] 也有期刊论文重新审视一致性正则化,指出其目标是训练对多种数据增强保持不变的模型,并考察了通过缩小不同增强视图所提取特征之间距离来施加不变性的做法,对这一做法作出了修正。[19]
一致性约束还被用于医学图像分割等任务,例如在多任务网络中约束分割结果与由距离图转换得到的掩码之间的一致性,或要求共享编码器的多个解码器输出彼此一致。[20]
参见
参考资料
- 2025.emnlp-main.139(PDF) . aclanthology.org [引用日期2026-09-27]
- 30ef30b64204a3088a26bc2e6ecf7602-Paper(PDF) . nips.cc [引用日期2026-09-27]
- 早期的半监督深度学习算法,主要分为两类: . nju.edu.cn [引用日期2026-09-27]
- ieee.org 上的 PDF 文件 . ieee.org [引用日期2026-09-27]
- [总结] 半监督学习方法: 一致性正则化(Consistency Regularization) . csdn.net [引用日期2026-09-27]
- aaai.org 上的文件 . aaai.org [引用日期2026-09-27]
- 半监督学习笔记(二) . zhihu.com [引用日期2026-09-27]
- ciSereArtiView . kci.go.kr [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- 2905-supp(PDF) . thecvf.com [引用日期2026-09-27]
- neurips.cc 上的网页 . neurips.cc [引用日期2026-09-27]
- paperdigest.org 上的网页 . paperdigest.org [引用日期2026-09-27]
- psu.edu 上的网页 . psu.edu [引用日期2026-09-27]
- ciSereArtiView . kci.go.kr [引用日期2026-09-27]
- research.google 上的网页 . research.google [引用日期2026-09-27]
- poster_06964dce9addb1c5cb5d6e3d9838f733 . neurips.cc [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- GPL_ICIP_NoteIEEE(PDF) . hal.science [引用日期2026-09-27]
- paper_detail . nstl.gov.cn [引用日期2026-09-27]
- cmig_HAL(PDF) . hal.science [引用日期2026-09-27]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-27T14:54:32Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。