Skip to main content
2025arXiv

VLA模型赋能真实世界机器人:全栈综述

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

本文提供了一份面向真实世界机器人部署的VLA全栈综述。来自东京大学、牛津大学和UT Austin的研究者系统性地梳理了VLA的设计策略演进、模态处理技术、训练范式、数据采集策略和评估基准。文章以实践者为中心,不仅涵盖模型架构,更深入讨论了机器人平台选型、遥操作数据采集和数据增强等工程细节,是VLA从实验室走向真实应用的实用指南。

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu
AI解读VLA机器人具身智能

论文概览

当大多数 VLA 综述聚焦于模型架构的创新,这篇来自东京大学、牛津大学和 UT Austin 的工作选择了一个独特而务实的视角:如何将 VLA 模型真正部署到真实的机器人系统上。这是一份全栈综述,覆盖了从软件到硬件、从训练到部署的完整链路。

文章开篇即给出了清晰的 VLA 定义:系统接收视觉观测和自然语言指令作为核心输入,直接生成控制指令——那些仅调用预定义技能库的高层规划策略不在此列。这一定义划定了评测的边界,也凸显了 VLA 研究的核心挑战:从感知到行动必须是端到端接地(grounded)的。

作者识别出 VLA 发展面临的四大根本挑战:首先是数据稀缺——同时满足"视觉+语言+动作"三模态需求的大规模数据集极度匮乏,而遥操作采集成本高昂;其次是跨形态迁移——不同机器人有着截然不同的关节配置、动作空间和感知布局,策略转移严重受阻;第三是计算与训练成本——Transformer 架构对序列长度的二次复杂度在实时机器人控制中面临严峻挑战;第四是安全与可靠性——开放世界的不可预测性要求 VLA 系统具备鲁棒的失效模式管理能力。

核心创新

本文对 VLA 架构演进进行了清晰的代际划分:

CNN 时代以 CLIPort 为里程碑。它将 CLIP 的特征提取能力与 Transporter Network 的操作能力结合,首次展示了预训练视觉语言模型赋能端到端操作的可能性。但 CNN+MLP 架构在统一多模态和规模化方面存在天然瓶颈。

Transformer 时代由 RT 系列和 Gato 开启。RT-1 和 RT-2 的意义在于首次证明了"将动作化为 token"这一简单想法的威力——当动作和文字共享同一个序列空间时,VLM 的语言理解和推理能力可以直接迁移到物理世界。OpenVLA 作为首个完全开源的 7B VLA 模型,大幅降低了大规模研究的门槛。

扩散/流匹配时代的代表是 Diffusion Policy、RDT-1B 和 π0。这类方法的核心洞见是:动作空间本质上是连续、多模态的,扩散模型天然适合捕捉这种复杂性。流匹配相比去噪扩散提供了更快的推理速度,使生成式动作建模在实际部署中变得可行。

层级架构时代以 π0.5、HiRT、HAMSTER 为代表,将 VLA 引向了一个更成熟的范式:高层 VLM 负责语义理解和任务分解,低层扩散或流匹配策略负责高频精密控制。这种"思维-行动"的分工模拟了人类认知的双加工理论——系统2的审慎推理与系统1的快速执行。

VLA全栈系统
VLA全栈系统

方法论

文章的独特贡献在于其实践导向的全栈视角

数据层,文章系统分析了遥操作采集的多种方式——从手持式示教器到运动学遥操作再到VR手套界面——各有利弊。Open X-Embodiment 的跨平台数据汇聚和 BridgeData 的多域任务覆盖是当前最关键的公开数据集。数据增强技术如场景随机化、光照变化和背景替换被证明能有效提升 sim-to-real 泛化。

模型层,文章详述了各模态的编码策略:视觉方面,SigLIP 提供语言对齐的语义特征,DINOv2 提供几何精确的空间特征,两者的混合(如 OpenVLA-OFT 的设计)成为事实标准;语言方面,Llama 和 Gemma 是最常见的 LLM 骨干;本体感受方面,MLP 将低维关节状态映射到共享的嵌入空间。

部署层,文章比较了主流机器人平台——Franka、UR5、xArm 等工业级机械臂和 Aloha 等低成本遥操作系统——各自的适用场景。推理延迟是部署的核心瓶颈:7B 参数的 VLA 模型在单 GPU 上的推理延迟通常在 50-200ms 范围,对于需要高频控制的接触式操作仍显不足。

VLA架构演进
VLA架构演进

实验结果

文章汇总了 VLA 模型在主流基准上的表现趋势:

在跨形态泛化方面,OpenVLA 在 7 种不同机器人平台上的平均成功率展现了 VLA 作为通用策略基座的潜力。但细致分析表明,模型在训练数据覆盖良好的形态上表现优异(70-85%),而在形态差异较大的场景中成功率骤降(20-40%),揭示了跨形态迁移的深层困难。

在数据效率方面,基于 VLM 预训练的 VLA 模型通常只需要 100-1000 个任务特有演示即可达到可用性能,而从头训练的纯策略则需要数量级更多的数据。这确认了 VLM 预训练作为"常识基础"的价值,但也显示 fine-tuning 阶段的分布偏移仍然是一个活跃的研究问题。

在实时性能方面,OpenVLA-OFT 通过非自回归解码将推理延迟降低了 3-5 倍,π0.5 的 chunk-wise 自回归策略在吞吐量和稳定性之间取得了最佳平衡。

启示与思考

这篇综述最引人深思的部分是其对VLA 实践者的直接建议

从"能做"到"做得好"还有很长的路要走。 当前 VLA 模型通常能在大约 50-70% 的未见任务中取得初始成功,但要达到工业级的可靠性(>95%)仍然充满挑战。这意味着 VLA 的部署必须嵌入选代改进的闭环——模型推理、失败检测、数据收集和持续微调。

硬件选择深刻影响模型设计。 不同于纯算法研究可以忽略硬件约束,实际部署中机械臂的运动学极限、感知传感器的更新频率和 GPU 的可用内存都在塑造可行的模型设计空间。譬如,固定基座机械臂和移动操作平台的观测噪声特性截然不同,导致相同的 VLA 模型在两者间的迁移远非即插即用。

安全不能是事后补丁。 当 VLA 在人类环境中运行时,错误的动作可能会导致实质性的物理伤害。文章呼吁将安全约束从训练阶段就嵌入 VLA 系统——不仅仅是动作空间的约束(如力限制),还包括任务层面的安全推理(如识别不稳定堆叠并规避)。

数据飞轮是 VLA 的加速器。 最成功的 VLA 系统(如 RT-2、π0 系列)背后都有庞大的内部数据采集基础设施支持。对于学术实验室和中小型公司而言,如何利用仿真数据增强、从人类视频中学习、以及最大化公开数据集的效用,是追赶前沿的关键策略。

总之,这篇综述的价值不在于提出新的架构创新,而在于它弥补了 VLA 研究中往往被忽视的"最后一公里"——如何把这些令人惊艳的模型变成能在真实世界中可靠工作的机器人系统。