Mamba 是一种基于状态空间模型(State Space Model,SSM)的序列建模架构, 由 Albert Gu 与 Tri Dao 于 2023 年 12 月提出。 它的主要价值在于把序列长度上的计算复杂度从 Transformer 的平方级 降到线性级,因而被视为长序列场景下 Transformer 的一条替代路线。
要解决的问题
Transformer 的自注意力机制要计算序列中每一对位置之间的关系, 序列长度翻一倍,计算量就变成四倍。这让它在处理很长的输入 (长文档、基因序列、音频)时代价急剧上升。
此前的状态空间模型虽然是线性复杂度,但有个硬伤: 状态转移矩阵是固定的,模型无法根据当前输入决定「记住什么、忘掉什么」, 在语言这类高度依赖上下文的任务上表现明显落后。
选择性机制
Mamba 的核心改动是让状态空间模型的参数随输入变化—— 这就是论文标题里「选择性」(Selective)一词的含义。 模型因此能根据当前词元决定信息的保留与丢弃, 获得了类似注意力机制的内容感知能力。
代价是失去了原本可以用卷积形式并行计算的结构。 作者为此设计了一套硬件感知的并行扫描算法, 把中间状态留在 GPU 的高速片上内存中,避免频繁读写显存。
影响
Mamba 发表后,SSM 与注意力机制的混合架构成为一个活跃方向, 不少工作尝试在同一个模型里同时使用两者, 以兼顾长序列的效率与注意力在精确检索上的优势。
参见
- RWKV —— 另一条非注意力路线
浏览次数:6 次
阅读量:6 次 · 阅读完成量:3 次
最近更新:2026-09-25T03:47:10Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。