Token-Level Attention

关注
义项:词元级注意力

Token-Level Attention(词元级注意力)是以单个词元为基本单位计算注意力权重的方法,即让每个词元分别与序列中的其他词元比较、分配权重并汇总信息,而不是在窗口、图像区域或固定区块等更粗的单位上做选择[1]。它是Transformer类模型处理上下文的核心环节,既决定信息如何在词元之间流动,也被用作长序列稀疏化与模型可解释性分析的操作粒度[2][3]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Token-Level Attention 属于注意力机制的一类,其判定标准是选择、加权或资源分配发生在单个词元的粒度上,而非发生在窗口、图像区域或固定区块等更粗的单元上[1]。在基于 Transformer 的架构中,它的典型形态是每个查询词元对序列内的全部键词元计算一组权重,再据此对值向量做加权求和[2]。

词元是模型处理数据序列时使用的基本单元,在文本中通常由子词切分给出,在其他模态中则可以把输入切成小块再映射为词元向量。因此词元级注意力并不专属于文本,只要模型把输入表示成词元序列,其注意力就落在这一粒度上[2][4]。

原理

词元级注意力以查询、键、值三组向量为基础。每个位置由输入向量经线性映射分别得到查询、键与值;查询与各个键做点积并除以维度平方根,经 softmax 归一化后成为权重;输出则是值向量的加权和,即 $o_i=\sum_{j}\alpha_{ij}V_j$,其中 $\alpha_{ij}=\mathrm{softmax}(q_i\cdot k_j/\sqrt{d})$[1]。

由于权重是在词元位置之间逐对计算的,注意力矩阵的规模为 N×N,N 代表序列长度,这也是长序列下代价随长度平方增长的原因[5][3]。多头注意力机制把查询、键、值投影到多个子空间并行计算,使不同的头可以分别捕捉不同类型的词元间关系[6]。


graph LR

A[词元序列] --> B[线性映射得到查询与键值]

B --> C[查询与键点积并缩放]

C --> D[softmax 归一化为权重]

D --> E[对值向量加权求和]

E --> F[输出词元表示]

发展历程

注意力机制最早用于改进循环神经网络在序列到序列任务上的表现,随后 Vaswani 等人在 2017 年 6 月提出完全以注意力为基础的 Transformer 架构,词元级注意力由此成为主流模型的骨干[7][8]。此后研究一方面把它扩展到语音、图像与多模态任务,另一方面围绕其计算代价发展出稀疏化、线性化等多种变体[1]。

在效率方向上,相关工作把稀疏化从区块粒度下推到词元粒度。国际机器学习会议上的 Token Sparse Attention 让每个注意力头独立挑选重要词元并压缩查询、键、值,未被选中的词元由残差连接保留,使每层都能基于完整上下文重新评估词元的重要性;该方法报告了最高约 3.23 倍的注意力加速与低于 1% 的精度损失,并观察到注意力稀疏度随上下文长度上升,从 4K 时的 17% 增至 128K 时的 54%[3]。

2022 年有学位论文以词性标记和词组为单位重新限定注意力的观测范围,并通过分块计算注意力矩阵降低长文本任务中的显存占用[5]。2025 年被 ICASSP 收录的一项工作把词元级上下文信息引入端到端语音识别,在 LibriSpeech 上报告词错误率下降 31.0% 与 23.3%,在 AISHELL-2 的命名实体集合上字符错误率下降 26.9%[9][10]。

应用

语音识别中的上下文偏置是词元级注意力的直接应用场景。相关上下文网络从上下文词元中提取信息,并把这类知识与声学特征融合,以缓解通用语音识别在长尾词与命名实体上的不足[9]。

在多模态生成中,有研究在文本条件的三维点云扩散模型里同时使用词元级交叉注意力与句子级语义特征调制,并采用停用词感知的注意力重加权来降低冠词、介词等词的影响;在椅子类别上,该策略把 COV-CD 由 37.18% 提升到 49.75%,JSD 由 12.2 降到 9.6[11]。

在模型分析方面,注意力权重被直接用作词元的可解释性评分。有综述性工作在 Transformer 之上附加软注意力模块,把注意力值当作词元级重要度,用于零样本序列标注,并报告其在此类任务上优于基于梯度的方法[12]。

局限

词元级注意力最主要的代价来自复杂度。注意力矩阵随序列长度按平方增长,长文本与长上下文推理时的显存占用和时延随之上升,这也是各类高效注意力方法出现的主要动因[5][3]。

以线性注意力为代表的近似方案把 softmax 核替换为特征映射,使复杂度降至与序列长度线性相关,但所有查询共享同一个全局摘要,逐词元的选择性被削弱,容易出现注意力分布高熵化和表示多样性下降的全局上下文坍缩[1]。针对稠密自注意力的分析也指出,反复的全局平均会压缩词元之间的方差,使隐藏表示的有效秩逐层下降并趋向秩一[13]。

把注意力权重当作解释同样存在争议。有研究证明在序列足够长时,存在无穷多组注意力权重可以产生相同输出,因此权重并不能唯一反映输入与输出之间的因果关系[8];也有工作显示模型可以被训练成对某些词元给出很低的权重,却仍在预测中依赖该信号,使权重看上去具有误导性[14]。

参见

  • 注意力机制 —— 词元级注意力是注意力机制按作用粒度划分出的一种形态。

  • 自注意力 —— 查询、键、值取自同一序列时,词元级注意力表现为自注意力。

  • 多头注意力 —— 在多个子空间中并行执行的词元级注意力。

  • Transformer —— 完全以注意力为基础、使词元级注意力得到普遍应用的架构。

  • 大型语言模型 —— 词元级注意力是其处理长上下文时的计算瓶颈所在。

  • 词元 —— 词元级注意力所作用的基本单位。

参考资料

  1. Token-Level Attention Mechanism . emergentmind.com [引用日期2026-09-29]
  2. Lecture 8: Transformers . mit.edu [引用日期2026-09-29]
  3. icml.cc 上的 PDF 文件 . icml.cc [引用日期2026-09-29]
  4. A Limitation of CNNs . umich.edu [引用日期2026-09-29]
  5. plu.mx 上的网页 . plu.mx [引用日期2026-09-29]
  6. These-Torba-Fatos-2025(PDF) . hal.science [引用日期2026-09-29]
  7. TEA Techniques - Responsible AI Design & Development . github.io [引用日期2026-09-29]
  8. Source: . ethz.ch [引用日期2026-09-29]
  9. ieee.org 上的网页 . ieee.org [引用日期2026-09-29]
  10. wanfangdata.com.cn 上的网页 . wanfangdata.com.cn [引用日期2026-09-29]
  11. ciSereArtiView . kci.go.kr [引用日期2026-09-29]
  12. 2021.repl4nlp-1(PDF) . aclanthology.org [引用日期2026-09-29]
  13. zenodo.org 上的 PDF 文件 . zenodo.org [引用日期2026-09-29]
  14. Transformers (Vaswani et al . upenn.edu [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:52:01Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
注意力机制 词元 Transformer 多头注意力 语音识别 可解释性 线性注意力 注意力机制 自注意力 多头注意力 Transformer 大型语言模型 词元
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。