ChatDLM

关注
义项:扩散语言模型

ChatDLM 是 Qafind Labs 于 2025 年 4 月发布的扩散语言模型 (Diffusion Language Model),把原本用于图像生成的扩散思路引入文本生成, 并与专家混合(Mixture-of-Experts,MoE)架构结合。 官方资料称其在 A100 GPU 上的推理速度可达每秒约 2800 个词元, 支持 131,072 tokens 的上下文窗口,参数量为 70 亿。

百科 图文
目录
  1. 技术路线
  2. 区块扩散
  3. 专家混合
  4. 长上下文支持
  5. 特点
  6. 说明
  7. 参见

技术路线

区块扩散

传统自回归模型逐个词元往下生成,前一个不出来后一个就动不了。 区块扩散(Block Diffusion)把输入按语义单元切成若干块, 每块独立做扩散计算,再通过跨块注意力交换全局信息。 官方称这一改动把复杂度从 O(n²) 降到 O(n log n)。

专家混合

模型配置了数十个专家模块,每次推理只激活其中两个, 由门控网络动态分派任务。这是 MoE 的常规做法: 参数总量大而单次计算量小,从而在精度与开销之间取得平衡。

长上下文支持

为支撑十万量级的上下文,模型在位置编码上做了 RoPE 相关优化, 并采用分层缓存。推理侧则用到动态早停、BF16 混合精度等手段。

特点

扩散式生成天然支持局部修改——要改一段文字中间的某处, 不必把后面全部重新生成一遍,这是自回归模型做不到的。 在公开的基准测试中,官方给出 HumanEval 约 92.0 的成绩。

说明

上述性能数据来自研发方公开发布的资料,尚未见独立第三方复现。

参见

  • Mamba —— 另一种非 Transformer 路线
词条评价
词条统计

浏览次数:8 次

阅读量:8 次 · 阅读完成量:7 次

最近更新:2026-09-25T03:47:10Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
Mamba
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。