ChatDLM 是 Qafind Labs 于 2025 年 4 月发布的扩散语言模型 (Diffusion Language Model),把原本用于图像生成的扩散思路引入文本生成, 并与专家混合(Mixture-of-Experts,MoE)架构结合。 官方资料称其在 A100 GPU 上的推理速度可达每秒约 2800 个词元, 支持 131,072 tokens 的上下文窗口,参数量为 70 亿。
技术路线
区块扩散
传统自回归模型逐个词元往下生成,前一个不出来后一个就动不了。 区块扩散(Block Diffusion)把输入按语义单元切成若干块, 每块独立做扩散计算,再通过跨块注意力交换全局信息。 官方称这一改动把复杂度从 O(n²) 降到 O(n log n)。
专家混合
模型配置了数十个专家模块,每次推理只激活其中两个, 由门控网络动态分派任务。这是 MoE 的常规做法: 参数总量大而单次计算量小,从而在精度与开销之间取得平衡。
长上下文支持
为支撑十万量级的上下文,模型在位置编码上做了 RoPE 相关优化, 并采用分层缓存。推理侧则用到动态早停、BF16 混合精度等手段。
特点
扩散式生成天然支持局部修改——要改一段文字中间的某处, 不必把后面全部重新生成一遍,这是自回归模型做不到的。 在公开的基准测试中,官方给出 HumanEval 约 92.0 的成绩。
说明
上述性能数据来自研发方公开发布的资料,尚未见独立第三方复现。
参见
- Mamba —— 另一种非 Transformer 路线
浏览次数:8 次
阅读量:8 次 · 阅读完成量:7 次
最近更新:2026-09-25T03:47:10Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。