BigBird

关注
义项:稀疏注意力模型BigBird

BigBird 是一种面向长序列的稀疏注意力机制,由谷歌团队在 2020 年提出,论文题为《Big Bird: Transformers for Longer Sequences》。它把全注意力对序列长度的二次方依赖降为线性,同时保留了全注意力模型的通用逼近能力与图灵完备性,在相近硬件条件下可处理的序列长度约为以往的 8 倍[1][2]。凭借更长的上下文,BigBird 在问答、摘要等长文档任务上取得提升,并被用于基因组序列建模[3]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

BigBird 是一种稀疏注意力机制,它不再让序列中的每个词元都与其余全部词元计算注意力,而是只计算其中一部分配对,以此压缩长序列建模所需的计算量与显存占用[1][2]。它并不改动 Transformer 的整体骨架,可以看作对原有注意力层的直接替换,因而能显著拉长 BERT 一类模型可处理的输入[4]。

论文给出的理论结论是,BigBird 既能逼近序列到序列的连续函数,又具有图灵完备性,说明注意力被稀疏化之后,全注意力模型原有的表达能力仍然保留[1][2]。

原理

论文把注意力机制描述成一张有向图,节点是序列中的词元,有向边代表一次查询与键的内积运算;全注意力对应一张完全图,稀疏化等价于在图上删去大部分边[2]。BigBird 由三类注意力共同构成:滑动窗口注意力只比较位置相近的词元;全局注意力让少数固定词元(例如分类标记 CLS)与整个序列交互;随机注意力为每个查询随机抽取若干键参与运算,用以补上前两者覆盖不到的远距离联系[3][2]。三者叠加之后,任意两个词元之间的信息仍能较快传递,这是稀疏图依然有效的原因[2]。

从复杂度看,全注意力的计算与显存开销随序列长度 $n$ 的平方增长,BigBird 把它降到与 $n$ 成正比:$O(n^2) \rightarrow O(n)$[1][2]。在实现上,它采用块稀疏的做法,先把序列按固定块大小切分,再按既定模式挑选参与计算的键块;若块大小记为 $b$、窗口块数为 $w$、全局块数为 $g$、随机块数为 $r$,则每个查询块只需与 $(g+w+r)b$ 个键计算,总体代价为 $O(n(g+w+r)bd)$[2]。这种结构化的稀疏模式便于在图形处理器和张量处理器上以密集矩阵乘法完成,从而获得实际加速[2]。


graph LR

A[输入序列] --> B[滑动窗口注意力]

A --> C[全局注意力]

A --> D[随机注意力]

B --> E[块稀疏注意力]

C --> E

D --> E

E --> F[序列表示]

发展历程

相关论文于 2020 年 7 月 28 日首次提交到预印本平台 arXiv,2021 年 1 月 8 日发布修订版本[5]。该成果随后入选神经信息处理系统大会(NeurIPS)2020,会议展示时间安排在 2020 年 12 月 8 日[6][5]。

论文由谷歌团队完成,领衔者为 Manzil Zaheer 与 Guru Guruganesh,合作者还包括 Avinava Dubey、Joshua Ainslie 等人[3][5]。该论文篇幅约 50 页,除方法本身外还包含稀疏注意力的理论分析与基因组方向的应用实验[3]。

官方代码与预训练模型在论文公开后发布在谷歌研究的开源仓库中[4]。Hugging Face 的 Transformers 库也集成了 BigBird,提供模型类、配置类与分词器,其默认配置采用块大小 64、随机块数 3、最大位置嵌入 4096,并把块稀疏注意力作为默认注意力类型。由于发布方没有提供模型卡,Hugging Face 团队依据论文补写了模型说明。

应用

BigBird 主要面向需要长上下文的自然语言处理任务。在问答与摘要等基准上,使用 BigBird 的模型在显存 16GB 时能处理的序列长度达到 RoBERTa 基线的 8 倍,而 Longformer 处理同样长度需要 48GB 显存,且只能使用一半批大小[3]。其掩码语言建模得分为 1.274,优于 RoBERTa 基线的 1.469(该指标越小越好),并在 Natural Questions、HotpotQA、TriviaQA 与 WikiHop 等数据集上超过 RoBERTa[3]。

BigBird 也被用于基因组数据。研究者把 DNA 序列切分为词元,用掩码语言建模目标在人类参考基因组上预训练,再针对具体任务微调;在启动子区域预测任务上取得 99.9 的 F1 值,在染色质轮廓预测中对组蛋白标记这类长程相关特征也有提升[2]。之所以适合这类数据,是因为 DNA 上的许多功能效应并不局限于局部位置[2]。

局限

稀疏化并非没有代价。论文指出,注意力越稀疏,往往就需要越多的层来补偿信息传递的不足,因此稀疏注意力并不能在所有场合替代全注意力[2]。此外,要达到与稠密注意力相当的效果,BigBird 需要比常规自注意力更多的超参数调优与架构搜索[3]。

工程实现上也有若干约束:序列长度必须能被块大小整除;当序列长度小于 1024 时,块稀疏注意力不带来收益,官方建议改用原始全注意力实现;当前实现不支持把随机块数量设为 0。

滑动窗口的设计依赖「局部性」假设,即一个词元的信息主要来自它邻近的词元[2]。对于语义关系需要跨越段落才能确定的文本,这一假设可能失效,论文评审中亦有评审人提出滑动窗口难以覆盖远距离语句关联的疑问[7]。在时序推理类问答数据上,基于 BigBird 的长上下文模型简单模式得分约 33%、困难模式约 27%,与人类水平差距较大[8]。

参见

  • Transformer —— BigBird 沿用其编码器结构,只替换其中的注意力计算方式

  • BERT —— BigBird 显著扩展了这类模型可处理的序列长度

  • Longformer —— 同样以降低注意力开销为目标的长序列模型,常与 BigBird 比较

  • 注意力机制 —— BigBird 改造的核心组件

  • 掩码语言模型 —— BigBird 预训练时采用的目标

参考资料

  1. Big Bird: Transformers for Longer Sequences . neurips.com.cn [引用日期2026-09-29]
  2. in DNA are highly non-local [12] . nips.cc [引用日期2026-09-29]
  3. deeplearning.ai 上的网页 . deeplearning.ai [引用日期2026-09-29]
  4. README . github.com [引用日期2026-09-29]
  5. Big Bird: Transformers for Longer Sequences . arxiv.org [引用日期2026-09-29]
  6. NeurIPS 2020 : Big Bird: Transformers for Longer Sequences . neurips.cc [引用日期2026-09-29]
  7. c8512d142a2d849725f31a9a7a361ab9-Review . neurips.cc [引用日期2026-09-29]
  8. 1f0e3dad99908345f7439f8ffabdffc4-Paper-round2(PDF) . neurips.cc [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:49:48Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
Transformer BERT Longformer 注意力机制 掩码语言模型
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。