视觉—语言—动作模型

关注
义项:多模态模型架构

视觉—语言—动作模型(Vision-Language-Action Model,简称 VLA)是一类多模态模型,处理视觉、语言与动作三种模态的信息,属于具身智能领域[1]。它把相机图像与自然语言指令作为输入,直接输出机器人可以执行的动作,在同一个框架内完成感知、理解与决策[2]。这一术语由谷歌深度思维在 2023 年的 RT-2 工作中提出[1],其意义在于把网络规模预训练所得的视觉语言知识迁移到机器人控制,提升机器人在新物体、新场景上的泛化能力[3]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

视觉—语言—动作模型是一类多模态模型,用来处理来自视觉、语言、动作三种模态的信息,主要服务于具身智能中的语言条件机器人任务[1]。按照 RT-2 研究团队给出的界定,只要一个模型能够接收视觉与语言组成的多模态输入,并输出机器人动作以完成具身任务,就可以归入这一类[4]。

在这一类模型出现之前,机器人的「看」「听」「做」由彼此独立的视觉模块、自然语言处理模块和运动规划控制模块分担,各模块既不了解任务上下文,也不了解物理约束,形成集成上的断层[4]。VLA 把原来分离的环节收进一个端到端的计算框架,让感知、推理与行动在同一模型中耦合起来[2]。

原理

典型的 VLA 模型包含四类核心组件:视觉编码器负责从相机图像中提取环境表征,语言编码器负责理解用户指令,多模态融合模块负责将两类表征对齐并整合,动作解码器则依据融合后的表征生成动作。动作既可以表示成离散的词元,也可以表示成连续数值[4]。

以策略的形式刻画,模型所学习的是从观测和指令到动作序列的映射:$\pi(a_{t:t+H} \mid o_t, l)$,其中 $o_t$ 为当前视觉观测,$l$ 为语言指令,$a_{t:t+H}$ 为随后若干步的动作[4]。

动作的表示方式把不同技术路线区分开来。RT-2 把机器人的连续动作切成离散档位后转写成字符串形式的词元,与自然语言词元放在一起训练,因此无需改动模型的输入输出接口[3]。另一条路线用扩散模型或流匹配直接生成连续动作轨迹,例如 π0 采用流匹配生成最高 50 Hz 的动作[5]。

在整体结构上还存在单系统与双系统的分野。单系统在一次前向计算中同时理解场景与指令并给出动作,结构简单、延迟较低;双系统把负责观察与规划的慢模块同负责动作生成的快模块拆开,两者端到端联合训练,灵巧性与响应速度更好,代价是计算结构更复杂[5]。由于视觉语言模型的推理频率通常在 1 至 10 Hz,而机器人伺服控制器的控制频率通常在 50 至 1000 Hz,二者之间的衔接要由底层控制器完成[4]。


graph LR

A[相机图像] --> C[视觉编码器]

B[语言指令] --> D[语言编码器]

C --> E[多模态融合]

D --> E

E --> F[动作解码器]

F --> G[机器人动作]

发展历程

2022 年,谷歌的 RT-1 用 13 台机器人历时 17 个月在办公厨房采集的演示数据训练,覆盖 700 多种任务,验证了用 Transformer 接收图像与文本输入、输出动作词元的可行路线[6]。这一多任务数据集后来成为后续模型的数据基础[3]。

2023 年 7 月,谷歌深度思维发布 RT-2,以 PaLI-X 和 PaLM-E 作为骨干网络,用网络图文数据与机器人轨迹数据联合微调,把动作当作词元来预测,首次把动作纳入视觉语言模型的输出空间。研究者在 6000 多次机器人试验中观察到,机器人在此前未见场景上的成功率从 RT-1 的 32% 提升到 62%[3]。VLA 这一术语即来自该工作[7]。

为缓解单一机器人数据不足的问题,多家机构联合构建了 Open X-Embodiment 数据集,把不同实验室的数据汇集起来,包含超过 100 万条轨迹和 20 多种机器人平台,用于训练跨本体模型[7]。

2024 年 6 月,斯坦福大学的研究者发布 70 亿参数的开源模型 OpenVLA,在 Open X-Embodiment 上训练,用 DINOv2 与 CLIP 提取视觉特征、以 Llama 2 作为语言骨干,输出离散动作词元,并支持参数高效微调与量化部署[5]。2024 年底,初创公司 Physical Intelligence 公布 π0,以 PaliGemma 为骨干并配有专门的动作专家,可控制单臂与双臂等多种构型的机械臂[5]。

2025 年 2 月,Figure AI 公开面向人形机器人的 Helix,采用双系统结构,可以较高频率控制人形机器人的手臂、手、躯干、头部与手指[5]。同年,英伟达的 GR00T N1 也采用双模块设计,由低层模块以 120 Hz 的频率驱动机器人动作[8]。研究热度随之上升,相关投稿在 ICLR 2026 上由上一年的个位数增加到 164 篇[9]。

应用

机器人操作是 VLA 最主要的应用方向,此外还用于自主导航与人机协助,并开始出现在边缘计算、工业自动化、医疗、农业和虚拟现实等场景中[2]。

与更早的深度强化学习方案相比,VLA 在复杂环境中的通用性、灵巧性与泛化性更好,因此既能用于工厂这类受控环境,也适合家庭中的日常任务[1]。在评测方面,研究者同时使用真实机器人平台与仿真环境,仿真环境可以低成本覆盖更多样的纹理、光照与相机位姿[10]。

局限

训练数据是最突出的瓶颈。机器人演示大多依靠遥操作逐条采集,成本高、规模小,视觉语言领域那种网络规模的语料并不存在,数据量不足会直接限制模型的上限[11]。即使在包含百万级片段的 Open X-Embodiment 上训练,模型面对分布外的环境和机器人配置仍然脆弱,往往需要补充采集数据再做微调[10]。

跨本体迁移是另一道障碍。不同机器人配备的关节、传感器与移动机构差别很大,动作空间与本体感知空间并不一致,在一个机器人集合上训练出的策略难以直接迁移到结构差异较大的平台上[11]。

计算与实时响应同样受限。这类模型参数量大、输入维度高,训练和微调都依赖大量算力,部署到机器人本地平台时还会遇到延迟与显存压力[11]。视觉语言骨干的推理频率明显低于伺服控制所需频率,精细操作的连续控制因此受到制约[4]。

有综述把跨模态语义对齐精度不足、任务泛化能力有限、实时响应效率受限和训练数据不完备列为四项主要挑战[12]。安全性、跨机器人动作泛化与效率等问题也仍被列为开放议题[13]。在评测层面,主流仿真基准已接近性能天花板,仿真环境中的高分未必能转化为真实世界的能力,数据集中的噪声与歧义也会影响模型表现[9]。

参见

  • 具身智能 —— VLA 模型所属的研究领域,强调智能体与物理世界的交互闭环。

  • 视觉语言模型 —— VLA 通常以其为骨干,并在此基础上增加动作输出能力。

  • RT-2 —— 首次提出 VLA 术语的代表性系统。

  • 扩散模型 —— 部分 VLA 用它作为动作解码方式,生成连续动作轨迹。

  • 大语言模型 —— VLA 的语言理解与推理部分常以其为基础。

  • 人形机器人 —— 双系统 VLA 的重要应用载体之一。

参考资料

  1. A Survey on Vision--Language--Action Models for Embodied AI . ieee.org [引用日期2026-09-29]
  2. ieee.org 上的网页 . ieee.org [引用日期2026-09-29]
  3. RT-2: New model translates vision and language into action . deepmind.google [引用日期2026-09-29]
  4. doi:10.3969/j . cast.org.cn [引用日期2026-09-29]
  5. Vision-language-action model . wikipedia.org [引用日期2026-09-29]
  6. 理モデルを内部に組み込んだ基盤モデルや複数モデルの統合的設計が鍵となる . jst.go.jp [引用日期2026-09-29]
  7. vision-language-action-models . digitalocean.com [引用日期2026-09-29]
  8. VLA(Vision-Language-Action)機器人的新智慧引擎 . digitimes.cn [引用日期2026-09-29]
  9. 最火VLA,看这一篇综述就够了 . baai.ac.cn [引用日期2026-09-29]
  10. vlachallenges_aaaismt(PDF) . jiajunwu.com [引用日期2026-09-29]
  11. ieee.org 上的 PDF 文件 . ieee.org [引用日期2026-09-29]
  12. cccf . hrbeu.edu.cn [引用日期2026-09-29]
  13. aaai.org 上的网页 . aaai.org [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:45:00Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
扩散模型 视觉语言模型 斯坦福大学 Figure AI 具身智能 视觉语言模型 RT-2 扩散模型 大语言模型 人形机器人
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。