RWKV

关注
义项:神经网络架构

RWKV(Receptance Weighted Key Value)是一种循环神经网络架构, 由彭博(网名 BlinkDL)发起并主导开发。 它的设计目标是同时拿到两样东西:Transformer 那样可以并行训练的效率, 以及循环神经网络那样在推理时的常数级开销。

百科 图文
目录
  1. 设计取舍
  2. 特点
  3. 参见

设计取舍

Transformer 之所以能高效训练,是因为整个序列可以一次性并行处理; 但代价是推理时要把已生成的全部上下文保留在显存里(KV 缓存), 显存占用随序列长度线性增长。

传统循环神经网络反过来:推理时只需维持一个固定大小的隐藏状态, 开销与序列长度无关;但训练必须按时间步依次进行,无法并行, 这让它在大模型时代几乎被放弃。

RWKV 的做法是不使用注意力机制,改用一套可以写成两种等价形式的计算: 训练时按并行形式展开,推理时按循环形式逐步执行。 两种形式算出的结果一致,于是训练效率与推理效率各取其长。

特点

由于推理时状态大小固定,RWKV 在理论上没有上下文长度的硬性上限, 而且显存占用不随对话变长而增加——这使它在资源受限的设备上有实际优势。

项目以开源方式推进,模型权重公开发布,社区参与度较高。

参见

  • Mamba —— 另一条非注意力路线
词条评价
词条统计

浏览次数:4 次

阅读量:4 次 · 阅读完成量:2 次

最近更新:2026-09-25T03:47:10Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
Mamba
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。