Pure VLA模型综述:自回归、扩散与强化学习的融合之路
Pure Vision-Language-Action (VLA) Models: A Comprehensive Survey
本文对纯VLA方法进行了系统分类——自回归方法将动作token化实现统一序列建模,扩散方法通过去噪过程捕捉连续动作分布,强化学习方法将环境反馈融入策略优化,混合方法与专业化方法则代表了前沿探索。来自兰州大学、新加坡国立大学和中科院计算所的团队综述了300+篇文献,覆盖机械臂、四足、人形和自动驾驶四大应用场景,为VLA研究提供了迄今最细粒度的方法分类学。
论文概览
Vision-Language-Action(VLA)模型的兴起标志着机器人控制从"专用策略"到"通用智能"的范式转换。然而,这一新兴领域的方法论版图仍在快速重组中——自回归、扩散、强化学习、混合架构等范式交叉演进,缺乏统一分类体系。来自兰州大学、新加坡国立大学和中科院计算所的联合团队,在这篇覆盖300余篇文献的综述中,提出了一个以"动作生成策略"为核心轴的细粒度分类学。
文章将 VLA 方法分为四大类别:自回归方法将动作序列化为 token,利用 Transformer 的序列建模能力;扩散方法通过去噪过程生成平滑、多模态的动作轨迹;强化学习方法将环境交互反馈融入策略优化;混合方法和专业化方法则代表了范式融合与领域特化的前沿。
一个关键的洞察是:VLA 的发展遵循"从单体到联合"的演进规律——从早期的视觉感知+语言理解+策略控制各自独立的分立管线,到 VLM 驱动的端到端统一框架,再到今天的分层混合架构。这一演进反映了领域对"统一性"和"精准性"之间张力的持续调和。
核心创新
自回归方法是 VLA 的奠基范式。 RT-1 率先将机器人控制转化为序列预测问题,RT-2 进一步将 VLM 的输出空间扩展到动作 token,使机器人策略继承了预训练 VLM 的语义理解和推理能力。OpenVLA 则通过完全开源 7B 参数模型验证了这条技术路线的可复现性。自回归方法的根本优势在于与 LLM 基础设施的无缝对接——训练框架、推理优化和量化技术均可直接迁移。
扩散方法为 VLA 引入了生成式建模的视角。 Diffusion Policy 奠定了"将策略学习视为条件生成问题"的范式,其后续 RDT-1B 和 TriVLA 等将扩散模型扩展到数十亿参数规模。扩散策略的核心优势在于它们天然适合建模连续、多模态的动作分布——对于任务"拧紧螺丝"而言,确实存在多种可行的扭矩序列,扩散模型可以自然而然地在这些解之间进行平滑插值。代价是推理时需要多步去噪,延迟通常高于自回归方法。
强化学习为 VLA 注入了自主改进的能力。 VLA-RL 将在线 RL 扩展到预训练的 VLA 骨干,使模型能够通过自主交互来超越模仿学习的数据分布限制。GR00T 将这一思路推广到类人操作场景。RL 的挑战在于需要在线环境交互——对于真实机器人,这不仅意味着物理磨损,还意味着安全风险。
混合方法代表了当前的 SOTA。 π0 开创了 VLM 理解 + 流匹配生成的架构范本,π0.5 进一步引入层级 Transformer,将高频动作控制与低频语义决策解耦。CoT-VLA 通过引入视觉链式思考,让模型在生成动作之前先"想象"关键子目标状态。

方法论
文章的方法论贡献在于构建了一个统一的分析框架来比较不同 VLA 范式:
表示维度:自回归方法将动作离散化为分类标签,便于语言模型处理但损失了连续控制精度;扩散方法直接建模连续分布,精度高但采样慢;混合方法在不同控制层面使用不同表示——关键帧用离散 token,轨迹用连续参数。
训练数据:自回归和扩散方法高度依赖大规模专家演示数据,通常需要数千至数百万条轨迹;RL 方法可以通过仿真交互大幅降低数据需求,但面临仿真迁移差距。文章详细梳理了 Open X-Embodiment、BridgeData V2、DROID 等关键数据集的特征和局限。
推理效率:扩散方法的去噪步骤数是最关键的效率因子——从最初的 1000 步缩减到 10-50 步(通过一致性模型等技术),是工程部署的关键突破。自回归方法受益于成熟的 KV-cache 和投机解码技术,推理延迟可优化至 50ms 以内。
应用覆盖:文章将 VLA 应用划分为四类——机械臂操作(抓取、组装、灵巧手)、四足机器人(运动控制、越障)、人形机器人(全身协调、双手操作)和轮式/自动驾驶。每类场景对 VLA 的要求大不相同:机械臂强调操作精度,四足强调动态稳定性,人形强调多自由度协调,自动驾驶强调安全性和实时性。

实验结果
文章综合了多类方法的定量比较:
在操作成功率方面,扩散策略在需要精细力控的接触式操作任务上普遍优于自回归方法(+5-15%),但在语义丰富的导航类任务中差异缩小。π0.5 的层级架构在长时程任务(>10步)上显著优于纯端到端方法,验证了"规划+执行"解耦的有效性。
数据效率方面,RL 方法在仿真环境中展现出压倒性优势——使用百万级仿真交互的 VLA-RL 在性能上追平了需要数千条人工演示的纯模仿方法。但 sim-to-real 迁移仍然是实际部署的最大不确定因素。
在跨形态泛化方面,基于 Open X-Embodiment 训练的模型在"相似形态"之间迁移效果良好(相对性能下降 <20%),但跨形态云(如从单臂到双臂、从固定基座到移动平台)的迁移仍然是一个开放问题。
启示与思考
这篇综述最深刻的洞察在于对 VLA 范式收敛方向的预判:
"纯"范式正在融合。 2025 年的趋势清晰地表明,最优的 VLA 系统不再是单一范式的纯粹实现,而是多个范式的有机融合。π0.5 将自回归语义决策与流匹配动作生成结合,VLA-RL 将预训练模仿策略与在线 RL 微调结合,MinD 将扩散生成与 RSSM 潜动力学结合。未来的 SOTA 可能属于那些能够优雅地组合多种学习信号的架构。
数据飞轮的构建是规模化 VLA 的前提。 文章反复强调的一个主题是:当前 VLA 的性能天花板不在于架构,而在于数据。谷歌的 RT 系列和 Physical Intelligence 的 π 系列之所以领先,很大程度上是因为它们背靠庞大的内部数据采集和标注基础设施。对于更广泛的研究社区而言,仿真数据生成和从人类视频中学习是两条最有前途的替代路径。
安全 VLA 是下一个必争之地。 随着 VLA 开始部署在真实环境中,安全问题从"可选优化"变为"硬性需求"。SafeVLA 等工作展示了将安全约束嵌入 VLA 训练的初步尝试,但这方面的研究仍然严重不足。未来 2-3 年内,安全 VLA 很可能成为一个独立且活跃的子领域。
从"会做"到"理解为什么做"是下一个飞跃。 当前的 VLA 本质上仍是模式匹配——输入感知和指令,输出动作。真正理解"为什么这个动作在这个场景中是合适的"——即因果性理解——仍然缺失。世界模型的集成(预测动作后果)和可解释推理链(为什么选择这个动作而非那个)是通往更深层次具身智能的关键路径。