扩散Transformer(Diffusion Transformer,DiT)是一类把Transformer当作主干网络的扩散模型,它用处理潜在图块的Transformer取代了扩散模型中常见的U-Net主干,并以Gflops衡量的前向计算量来考察模型的可扩展性[1]。该架构由William Peebles与谢赛宁在2022年12月发表的论文中提出。由于模型与数据规模扩大时生成质量能持续改善,DiT后来成为文生视频模型Sora、文生图模型Stable Diffusion 3等系统的基础架构[2][3]。
定义
扩散Transformer是一种以Transformer为主干的扩散模型,去噪过程中的噪声预测由Transformer承担。与早期扩散模型普遍采用U-Net作为主干的做法不同,它先把数据的潜在表示切分成图块,再把这些图块当作序列交给标准Transformer处理[1]。它属于潜变量模型的一支,学习目标是逼近从纯噪声反向还原数据的去噪过程[4]。
原理
扩散模型的训练做法是向数据逐步加入高斯噪声,使其原有结构被掩盖,再由网络学习相反方向的操作,采样时从随机噪声出发逐步还原出样本[4]。DiT把这一预测任务交给Transformer:图像的潜在表示被切成图块,配以位置信息后以序列形式进入多层Transformer块[1]。
条件信息(如类别标签或文本)如何接入网络有多种方案,DiT的论文比较了自适应层归一化、交叉注意力和额外输入图块3种方式,其中自适应层归一化的效果最好[4]。论文还用前向传播的计算量(Gflops)衡量可扩展性,结果显示通过加深或加宽Transformer、增加输入图块数量来提升Gflops时,FID指标会随之下降[1]。
用于视频时,Sora一类模型先以自编码器把视频压缩到时间和空间上都被压缩的潜在空间,再拆成时空图块作为标记送入Transformer,去噪完成后由解码器映射回像素空间[5]。整体流程可概括为:
flowchart LR
A[图像或视频] --> B[编码器压缩到潜在空间]
B --> C[切分为潜在图块并加入位置信息]
C --> D[Transformer块预测噪声]
D --> E[迭代去噪得到潜在表示]
E --> F[解码器还原为像素]
训练时图块大小的选择也会影响规模:输入图块数量增加会提高计算量,从而改变模型的Gflops与生成质量之间的关系。
发展历程
相关论文《Scalable Diffusion Models with Transformers》最早于2022年12月公布,2023年3月更新了第二版。论文训练的是图像的潜扩散模型,用对潜在图块做运算的Transformer替换了常用的U-Net主干,并给出按深度与宽度区分的DiT-S、DiT-B、DiT-L与DiT-XL等4种配置。据Yann LeCun透露,这篇论文先被CVPR 2023以缺乏创新为由拒稿,后在ICCV 2023被接收[6]。
2024年1月,谢赛宁团队在DiT基础上提出可扩展插值Transformer,把插值框架引入该架构,在相同主干下获得了更好的质量、速度与灵活性,其在ImageNet 256上的FID为2.06。
2024年2月,OpenAI发布文生视频模型Sora,其技术报告称该模型属于扩散Transformer,训练与生成都在压缩后的潜在空间中进行,由配套解码器把潜在表示还原到像素空间[5]。2024年3月,Stability AI公布Stable Diffusion 3的技术报告,其多模态扩散Transformer架构建立在DiT之上,为文本与图像两种模态分别设置权重,并在注意力运算中拼接两者的序列[3]。此后出现的Flux.1把参数量推进到120亿,采用双分支块与单分支块混合的共57个Transformer块[7]。
应用
在图像生成方面,DiT-XL/2在类别条件的ImageNet 512×512与256×256基准上超过了此前的扩散模型,在256×256上取得2.27的FID[1]。
在文本到图像生成方面,Stable Diffusion 3用两个CLIP模型和一个T5模型编码文本、用改进的自编码模型编码图像标记,训练规模覆盖15个模块、4.5亿参数到38个模块、80亿参数的多档模型[3][8]。
在视频生成方面,规模最大的Sora模型可生成长达1分钟的高保真视频,并支持不同的时长、分辨率与宽高比[2]。OpenAI在技术报告中提出,持续扩大这类视频生成模型的规模可用于模拟物理世界与数字世界[5]。
高分辨率方向亦有相应探索,PixArt-Sigma展示了扩散Transformer生成最高4K图像的能力,开源的视频生成模型OpenSora同样采用这一架构[9]。
局限
自注意力的计算量随标记数量呈二次增长,这是DiT的主要瓶颈,在生成长图块序列(如高分辨率图像或长时间视频)时尤为突出[10][11]。
实测数据也反映了这一开销:在DiT-B/4、批大小为8、使用A100显卡的设置下,自注意力占单个DiT块推理延迟的42.6%[12]。为缓解该问题出现了多种压缩与稀疏化方案,例如DiTFastAttn最多可减少76%的注意力浮点运算量,在2K×2K生成上取得最高1.8倍的端到端加速[9];面向8K分辨率图像的线性化方法把注意力计算量降低99.5%、生成速度提升6.3倍[10]。
分辨率外推是另一项限制:DiT难以生成高于训练分辨率的图像,原因在于RoPE等显式位置编码需要在训练时未出现的位置上外推,性能会随之下降[13]。
面向多模态时,原版DiT依赖交叉注意力接入文本条件,而多模态扩散Transformer取消了这一模块,改为把文本与图像表示各自投影后拼接再做联合自注意力,说明其条件注入结构需要相应改造[14]。
参见
-
Transformer —— DiT 用这一架构替换扩散模型原有的主干网络。
-
U-Net —— DiT 出现前扩散模型常用的主干网络。
-
扩散模型 —— DiT 所属的生成模型大类。
-
多模态扩散Transformer —— 在 DiT 基础上为文本与图像分别设置权重的架构。
-
Sora —— 把 DiT 用于视频生成的文生视频模型。
-
可扩展插值Transformer —— 谢赛宁团队在 DiT 之后提出的改进架构。
参考资料
- Scalable Diffusion Models with Transformers . thecvf.com [引用日期2026-09-29]
- Sora技术详解及影响分析! . baai.ac.cn [引用日期2026-09-29]
- Stable Diffusion 3: Research Paper — Stability AI . squarespace.com [引用日期2026-09-29]
- 解读OpenAI Sora文生视频技术原理 . shisu.edu.cn [引用日期2026-09-29]
- OpenAI 的 Sora 技术报告详解 . aliyun.com [引用日期2026-09-29]
- 揭秘Sora技术路线:核心成员来自伯克利,基础论文曾被CVPR拒稿 . 163.com [引用日期2026-09-29]
- thecvf.com 上的 PDF 文件 . thecvf.com [引用日期2026-09-29]
- Stable Diffusion 3技术报告出炉:揭露Sora同款架构细节 . baai.ac.cn [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- e36da7acd188c6655792270b38830124-Abstract-Conference . neurips.cc [引用日期2026-09-29]
- ieee.org 上的网页 . ieee.org [引用日期2026-09-29]
- 1598_ZGEupFz(PDF) . thecvf.com [引用日期2026-09-29]
- 20c31fffbf2a88b9a749abc8cd9dd88c-Abstract-Conference . nips.cc [引用日期2026-09-29]
- Appendix . thecvf.com [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:45:01Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。