大VLM驱动的VLA模型:机器人操作的范式革新
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
这篇来自哈工大深圳的综述首次对大VLM驱动的VLA模型进行了系统的分类学梳理。文章提出两大核心架构范式:单体模型(单一系统与双系统)将感知、推理和动作统一在端到端框架中;层级模型则通过可解释的中间表示(子任务、关键点、程序、可供性)解耦规划与执行。此外,文章还深入探讨了强化学习整合、免训练优化、人类视频学习和世界模型集成四大前沿方向,为VLA研究的未来发展绘制了清晰路线图。
论文概览
大型视觉语言模型(VLMs)的崛起正在重新定义机器人操作的可能性边界。当 VLM 不再仅仅停留在"看懂"和"理解"的层面,而是能够驱动真实的物理动作时,一种新的模型范式——大 VLM 驱动的 VLA——应运而生。
来自哈尔滨工业大学(深圳)的研究团队,在这篇面向 Large VLM-based VLA for Robotic Manipulation 的首篇系统综述中,提出了一个清晰的二分架构分类学。文章的核心洞察是:大 VLM 驱动的 VLA 可以分为两大范式——单体模型(Monolithic Models)将感知、推理和动作生成集成在统一架构中;层级模型(Hierarchical Models)则显式地解耦规划与执行,通过可解释的中间表示来桥接两者。
文章明确定义了大 VLM-based VLA 的三个必要条件:(1) 利用大 VLM 理解视觉观测和自然语言指令;(2) 执行直接或间接服务于动作生成的推理过程;(3) 最终产出可执行的机器人控制指令。这一定义将仅用 VLM 做高层规划然后调用预定义技能库的系统排除在外,锁定了真正意义上的"端到端具身"。
核心创新
单体模型的两种实现各有优劣。单一系统模型如 RT-2 和 OpenVLA 将 VLM 的输出空间直接扩展到动作 token,"像生成文字一样生成动作"——这种设计最简洁,代码最少,但当任务变得复杂时,单一模型要同时优化感知、推理和动作三个目标,往往顾此失彼。双系统模型如 GraspVLA 和 DeeR-VLA 引入了一个"动作专家"组件,VLM 负责语义理解和场景解释,动作专家负责将理解转化为动作——这种分工在精密操作任务中表现出色,代价是增加了系统复杂度和训练挑战。
层级模型的中间表示是本文最独到的分析维度。文章识别出四种主要的中间表示类型:
- 子任务 (Subtask):VLM 将高层指令分解为一系列子任务,下游策略逐一执行。SayCan 和 Inner Monologue 是此范式的开山之作。
- 关键点 (Keypoint):VLM 识别场景中的关键空间位置(如"茶杯的把手"、"桌面的右边缘"),策略基于这些关键点生成轨迹。VoxPoser 通过 LLM 生成 3D 可供性地图来约束动作空间。
- 程序 (Program):VLM 生成可执行的代码或规划来表达任务逻辑,策略执行这些代码。Code as Policies 和 ProgPrompt 将任务规范转化为 Python 代码。
- 可供性 (Affordance):VLM 输出场景中各区域的"可操作性"信息——哪里可以抓取、哪里可以放置。CLIPort 和 InstructVLA 利用可供性图来引导动作生成。

方法论
文章的分析框架覆盖了大 VLM-VLA 的完整技术栈:
VLM 骨干选择是最关键的设计决策。文章比较了主流 VLM 在机器人操作场景中的适应性:LLaVA 系列(对话式交互能力强)、Qwen-VL 系列(动态分辨率支持好)、InternVL2(自动化数据清洗管线)和 PaLI/PaLM-E(Google 的内部优选)。选择标准不仅包括基准分数,还包括推理延迟、内存占用和微调便利性。
模态融合策略随架构范式而异。单体模型常用"后期融合"——各模态独立编码后在 Transformer 中交叉注意力——简单但可能丢失低层物理信息。层级模型则倾向"早期融合"关键信息(如将深度图作为额外通道拼接到 RGB 图像)以提升规划层对 3D 空间的理解。
训练范式反映了从"纯模仿"到"模仿+交互"的演进。大多数大 VLM-VLA 从模仿学习起步,使用遥操作采集的专家演示进行监督微调。但纯模仿的分布外脆弱性促使研究者探索补充策略:VLA-RL 引入在线 RL 微调,SENSEI 利用 VLM 蒸馏的语义奖励来引导探索。
实验结果
文章系统性地归纳了大 VLM-VLA 的实证发现:
规模至关重要。更大 VLM 骨干几乎总是带来更好的零样本泛化——RT-2 的 55B 版本在未见任务上的表现显著超越 5B 版本,OpenVLA 的 7B 模型在跨形态任务上也有可观的零样本能力。但这种改进不是线性的——从 7B 到 55B 的增益远小于从 1B 到 7B,且推理延迟呈非线性增长。
层级模型在复杂任务上占优,但简单任务上反而不如单体模型。 当任务需要多步推理和复杂操作(如"从杂乱的抽屉中找到螺丝刀并用它拧紧松动的椅子腿"),层级模型的子任务分解提供了关键的结构化引导。但对于简单的抓放操作,层级架构的额外开销(规划时间 + 中间表示的生成)反而降低了端到端效率。
中间表示的选择深刻影响泛化能力。 基于关键点和可供性的中间表示比基于显式子任务的表示更具跨场景泛化能力——因为"抓取点"的概念在不同场景间是共享的,而"把杯子放在桌上"这个子任务的执行细节则高度依赖具体的场景布局。

启示与思考
这篇综述为 VLA 研究的未来提供了几个高度前瞻的方向:
记忆机制是大 VLM-VLA 的下一个关键组件。当前的 VLA 系统本质上是无状态的——每一帧独立决策,不携带对历史交互的记忆。当机器人需要执行需要长期背景的任务(如"记得你刚才放在哪里的螺丝刀"),缺乏情景记忆会严重限制能力。MemoryVLA 等工作开始在 VLA 中引入显式记忆模块,但这一方向仍处于起步阶段。
4D 感知将时间维度引入空间理解。BridgeVLA 的多视图点云渲染、TraceVLA 的时序关键点追踪、3D-VLA 的生成式 3D 世界模型,都在推动 VLA 从 2.5D 快照感知走向真正的时空理解。这对需要预测运动轨迹和物理交互的任务至关重要。
高效适应是从"通用基础模型"到"专用工作模型"的桥梁。全参数微调一个大 VLM 在计算上对大多数实验室而言是不可行的。LoRA、QLoRA 等参数高效微调技术正在 VLA 领域获得广泛采用,但如何在不损失跨任务泛化能力的前提下实现高效领域适配,仍然是一个开放问题。
多智能体协作将 VLA 从"独奏"拓展到"合奏"。当多个 VLA 驱动的机器人需要在共享空间中协作(如仓库中的协同分拣),如何在 VLM 的推理框架内编码多智能体协调逻辑——沟通、分工、冲突解决——是一个尚未被充分探索但极具实用价值的前沿。
**从"听从指令"到"主动提问"**是 VLA 智能性的下一个跃迁。当指令模糊或不完备时("帮我整理一下"),人类会主动追问以澄清意图。AskToAct 等开创性工作已经开始探索让 VLA 系统具备主动澄清能力,这将使人机交互从单向指令传递转向真正的协作对话。
这篇综述的价值在于,它不仅描绘了大 VLM-VLA 的"现状",更勾勒了从现状到未来的清晰路径——每一步的挑战是什么,哪些方向最有希望,哪些方案已被尝试。对于任何一个想要进入或深入这一领域的研究者,这都是一份不可多得的导航图。