Mamba

关注
义项:序列建模架构

Mamba 是一种基于状态空间模型(State Space Model,SSM)的序列建模架构, 由 Albert Gu 与 Tri Dao 于 2023 年 12 月提出。 它的主要价值在于把序列长度上的计算复杂度从 Transformer 的平方级 降到线性级,因而被视为长序列场景下 Transformer 的一条替代路线。

百科 图文
目录
  1. 要解决的问题
  2. 选择性机制
  3. 影响
  4. 参见

要解决的问题

Transformer 的自注意力机制要计算序列中每一对位置之间的关系, 序列长度翻一倍,计算量就变成四倍。这让它在处理很长的输入 (长文档、基因序列、音频)时代价急剧上升。

此前的状态空间模型虽然是线性复杂度,但有个硬伤: 状态转移矩阵是固定的,模型无法根据当前输入决定「记住什么、忘掉什么」, 在语言这类高度依赖上下文的任务上表现明显落后。

选择性机制

Mamba 的核心改动是让状态空间模型的参数随输入变化—— 这就是论文标题里「选择性」(Selective)一词的含义。 模型因此能根据当前词元决定信息的保留与丢弃, 获得了类似注意力机制的内容感知能力。

代价是失去了原本可以用卷积形式并行计算的结构。 作者为此设计了一套硬件感知的并行扫描算法, 把中间状态留在 GPU 的高速片上内存中,避免频繁读写显存。

影响

Mamba 发表后,SSM 与注意力机制的混合架构成为一个活跃方向, 不少工作尝试在同一个模型里同时使用两者, 以兼顾长序列的效率与注意力在精确检索上的优势。

参见

  • RWKV —— 另一条非注意力路线
词条评价
词条统计

浏览次数:6 次

阅读量:6 次 · 阅读完成量:3 次

最近更新:2026-09-25T03:47:10Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
RWKV
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。