一致性模型(Consistency Models,简称 CM)是一类生成模型,它让模型把概率流常微分方程轨迹上的任意一点直接映射回该轨迹的起点,因此只需一次网络评估即可生成样本,不必像扩散模型那样反复迭代。[1] 它既可通过蒸馏预训练扩散模型得到,也可脱离扩散模型独立训练,而且无需对抗训练;一步生成在 CIFAR-10 上取得 FID 3.55 的结果。[2]
定义
一致性模型的名字来自它的自一致性(self-consistency)性质:落于同一条概率流常微分方程(PF-ODE)轨迹上的任意两点,经一致性函数映射后应当得到同一个初始点。[3][4] 形式化地说,一致性函数写作 $f:(\mathbf{x}_t,t)\mapsto\mathbf{x}_\epsilon$,其中 $\mathbf{x}_t$ 表示轨迹上时刻 $t$ 的含噪状态,$\mathbf{x}_\epsilon$ 是该轨迹起点的干净样本。[1]
按训练方式划分,一致性模型有蒸馏模式与孤立模式两类。蒸馏模式把预训练的扩散模型压缩成单步采样器,孤立模式则不依赖任何预训练扩散模型,从而使一致性模型本身成为一类独立的生成模型。[1] 两种方式都不需要对抗训练,对网络结构的限制也较宽松。[1]
原理
一致性模型建立在连续时间扩散模型的概率流常微分方程之上。该方程把数据分布平滑地转换为可采样的噪声分布,其解构成一条从数据指向噪声的轨迹。[1] 与传统做法不同,一致性模型不逐步求解这条轨迹,而是直接学习一个函数,把轨迹上任何时刻的状态一次映射到轨迹起点。[5][6]
训练主要有两条路线。一致性蒸馏借助数值 ODE 求解器和预训练扩散模型,在轨迹上取相邻的两点,通过缩小两点的模型输出差距,把扩散模型的知识转移到单步采样器上。[1] 一致性训练则不使用预训练模型,它以相邻时间步之间的一致性作为约束直接从零训练;训练中通常使用指数移动平均的参数副本作为目标,并用感知度量(如 LPIPS 距离)衡量输出差异以稳定过程。
在采样阶段,一次前向计算即可由随机噪声得到样本,即把轨迹终点直接送入一致性函数。[1] 若需要更高质量,可以把多个时间步的输出串联起来,在去噪与再次加噪之间交替,用更多计算量换取更好的样本质量。[1] 这种质量与计算量之间的可调节性,是该模型相对既有单步生成方法的一个特点。[5]
graph LR
A[随机噪声 x_T] --> F[一致性函数 f_θ]
B[轨迹上任意点 x_t] --> F
F --> C[样本 x_ε]
发展历程
2023 年,宋飏与 Prafulla Dhariwal、Mark Chen、Ilya Sutskever 共同提出一致性模型,相关论文在第 40 届国际机器学习大会(ICML 2023)上发表。[7][2] 论文显示,该模型在一步与少步生成上超过了此前的扩散模型蒸馏方法。[2]
2023 年 5 月,OpenAI 公开了一致性模型的代码实现与模型权重。[8] 同年 10 月,清华大学的研究者受其启发提出潜在一致性模型(LCM),把概率流常微分方程的求解搬到潜在空间,用于文本到图像的少步生成。[9]
2024 年,分阶段一致性模型(Phased Consistency Models)在神经信息处理系统大会(NeurIPS)上发表。[3] 同一时期,宋飏与 Prafulla Dhariwal 又提出改进一致性模型训练的技术。[7]
此后研究继续向不同方向扩展。有工作把一致性模型推广到黎曼流形上,[10] 也有工作针对采样中的时间离散化提出自适应方案。[6] 另有研究提出 Poisson 一致性模型与耦合一致性模型,把潜在变量的先验分布从高斯形式推广到其他形式。[11]
应用
最直接的用途是图像生成中的加速采样。作为蒸馏方法,一致性模型在 CIFAR-10 上一步与两步生成的 FID 分别为 3.55 与 2.93,在 ImageNet 64×64 上一步与两步生成的 FID 为 6.20 与 4.70。[1] 当以独立生成模型的方式训练时,它也能在多个标准数据集上超过已有的单步、非对抗生成模型。[2]
另一类应用是零样本数据编辑。由于自一致性性质,只要在输入中部分替换已知区域或加入引导信号,一致性模型就能完成图像修复、上色与超分辨率等任务,而无需针对这些任务做专门训练。[2][1]
文本到图像方向,潜在一致性模型可以直接用于 Stable Diffusion 等潜在扩散模型,以 2 至 4 步推理生成 768×768 的高分辨率图像,训练开销约为 32 个 A100 GPU 小时;其配套的潜在一致性微调还能在自定义数据集上继续调整模型,并保持少步推理能力。[9]
在图像重建类任务中,一致性模型被用作即插即用先验:它可以从扩散常微分方程轨迹上的任意一点直接预测最终输出,使逆问题的求解只需少量网络函数评估。[12]
局限
两种训练方式的效果并不对等。据相关实验,采用蒸馏方式训练的一致性模型在生成高质量图像方面优于完全孤立训练的一致性模型,因此不依赖预训练扩散模型这一优势需要以质量上的让步为代价。[13]
一步生成的样本质量仍然有限,通常要靠增加采样步数来改善,而这种取舍本身就说明单次映射尚不能完全替代迭代采样。[1] 多步采样还受时间离散化方式影响,离散化不当会削弱生成效果,后续研究为此专门提出了自适应离散化。[6]
原始形式以高斯形式的先验和欧氏空间为基础,向更一般的分布或几何结构推广时需要额外的机制设计。例如把先验分布扩展到非高斯形式,需要引入 Poisson 一致性模型、耦合一致性模型等新方案,[11] 在黎曼流形上则需重新定义轨迹与映射。[10]
参见
参考资料
- Consistency Models . arxiv.org [引用日期2026-09-29]
- ICML Poster Consistency Models . icml.cc [引用日期2026-09-29]
- Phased Consistency Models . neurips.cc [引用日期2026-09-29]
- 352b13f01566ae34affacc60e98c16af-Paper-Conference(PDF) . neurips.cc [引用日期2026-09-29]
- 1 More Discussion of Preliminaries . thecvf.com [引用日期2026-09-29]
- Adaptive Discretization for Consistency Models . neurips.cc [引用日期2026-09-29]
- publications . yang-song.net [引用日期2026-09-29]
- 终结扩散模型:OpenAI开源新模型代码,一步成图,1秒18张 . aliyun.com [引用日期2026-09-29]
- huggingface.co 上的网页 . huggingface.co [引用日期2026-09-29]
- Riemannian Consistency Model . neurips.cc [引用日期2026-09-29]
- footnotes . IEEE Xplore [引用日期2026-09-29]
- thecvf.com 上的网页 . CVF Open Access [引用日期2026-09-29]
- bda6df40126f791a144ac2bd500679db-Paper-Conference(PDF) . neurips.cc [引用日期2026-09-29]
- See Further When Clear: Curriculum Consistency Model . IEEE Xplore [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:44:44Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。