ICLR 2026 VLA 研究现状:从爆发式增长到基准饱和的反思
State of VLA Research at ICLR 2026
Moritz Reuss(FLOWER 作者)撰写的深度博客,对 ICLR 2026 的 164 篇 VLA 论文进行了全景式分析。核心洞察:VLA 提交量一年增长 18 倍,但仿真基准已近饱和,开源 VLA 与闭源前沿(Gemini Robotics、Pi0.5)之间的零样本泛化差距依然巨大。
概述
这不是一篇传统论文,而是作者 Moritz Reuss(FLOWER 模型作者)对 ICLR 2026 VLA 研究现状的深度分析博客。由于作者自己身处 VLA 研究一线(其 FLOWER 模型在 CALVIN 基准上达到 SOTA),这篇文章比一般的会议总结更具有内行视角和批判性。
文章的核心观点可以用一句话概括:VLA 领域正经历爆发式增长,但仿真基准的饱和掩盖了开源模型与工业级系统之间的真实差距。
VLA 的定义之争
Reuss 给出了一个我认为很精准的个人定义:VLA 的关键区分特征不是"能输出动作",而是"使用了互联网规模的视觉-语言预训练骨干"。
具体来说:
- 仅使用分别预训练的文本编码器(CLIP-text)和视觉编码器(DINOv2)的模型 → 多模态策略(multimodal policy),不是 VLA
- 使用了预训练视频生成模型作为骨干的 → Video-Action Policy
这个定义很有价值,因为它解释了一个令人困惑的现象:为什么有些"VLA"论文在基准上表现很好,但零样本泛化很弱——因为它们实际上缺少真正的互联网规模视觉-语言预训练。
他还做了一个坦诚的评价:
"Most current VLAs still struggle with zero-shot generalization and complex tasks, making them better described as 'less dumb multi-modal policies' rather than truly general robot brains."
这句话虽然幽默,但点出了领域现状的核心矛盾。
爆发式增长与隐藏差距
数量上的爆发
| 会议 | VLA 关键词提交数 |
|---|---|
| ICLR 2024 | 1 |
| ICLR 2025 | 9 |
| ICLR 2026 | 164 |
一年内增长 18 倍。Reuss 预计 ICLR 2027 可能达到 2100+ 篇——这个预测既令人兴奋又让人忧虑。
仿真与现实的鸿沟
这是全文最关键的洞察。作者以自己为例:
- FLOWER 在 CALVIN 所有基准上均为 SOTA
- 但远不及 Gemini Robotics VLA 展示的零样本鲁棒性
- 仿真基准的高分掩盖了这一差距
差距的原因有六个:
- 基准进度饱和:当 LIBERO 上大家都是 95-98%,"+0.5%"不是真实改进的证据
- 数据质量差距:开源数据(如 OXE)在多样性和规模上有限
- 示范数据理解缺口:缺乏对高质量示范数据的系统理解
- 评估范围狭窄:大多数论文仅报告仿真或小规模微调结果
- 运营约束:研究组缺乏大规模多样化真实世界试验的资源
- 同行评审激励缺失:审稿人期望在标准仿真上与闭源模型做头对头比较
基准解读实用指南
Reuss 给出了一套实用的基准判读标准:
-
LIBERO:基本已被解决。Spatial/Object/Goal >95% 为预期水平,Long 90-95%。低于 90% 仅对 static-camera-only 可接受。99% vs 98% 的对比无意义。有趣的讽刺:LIBERO 设计为终身学习基准,但 99% 的模型都在完整数据集上训练,根本不做持续学习。
-
CALVIN:也接近饱和。ABC 版本 >4 为标准,>4.5 为 SOTA。ABCD 版本 >4.5 为相关结果。
-
SIMPLER:跨设置难以解读。Bridge 上成功率跨度 40-99%,跨论文比较噪声大。Google Robot 版本当前 SOTA 约 70-80%。
一个特别有启发性的观察:任何真实世界结果都非常重要,仅仿真难以信任,尤其对于 7B+ 参数的大型 VLA。
八大研究趋势
文章将 ICLR 2026 的 VLA 论文分为 8 个主要方向:
-
离散扩散 VLA(4 篇):最大趋势。解决了自回归 ECoT 的慢速推理瓶颈,允许并行生成。代表工作包括 DISCRETE DIFFUSION VLA、dVLA、DIVA。
-
ECoT 推理 VLA(4 篇):具身思维链训练。关键挑战是灾难性遗忘——直接在 VLM 上用离散动作 token 微调会破坏 VLM 的推理能力。代表工作 Actions as Language(用子任务重标注数据 + LoRA 微调)。
-
新离散 Tokenizer(2 篇):FASTer(频域 DCT + RVQ)和 OmniSAT(B-Spline + VQ-VAE)。
-
高效 VLA(2 篇):HyperVLA(超网络生成任务特定小策略)和 AutoQVLA(仅需 30% VRAM 的量化)。
-
RL for VLA(2 篇):残差 RL 和阶段感知 RL。
-
视频预测 VLA(3 篇):UniVLA(统一 visual-language-action token 流)、Cosmos Policy(微调 NVIDIA Cosmos)。
-
评估与基准(3 篇):RobotArena、RoboCasa365、WorldGym。
-
跨动作空间学习(3 篇):X-VLA(soft-prompting tokens)、XR-1(Unified Vision-Motion Codes)。
两个被低估的问题
Reuss 指出了两个在 ICLR 2026 中几乎无人关注但至关重要的问题:
数据质量
尽管对 VLA 性能至关重要,几乎没有提交关注数据收集和策划。OXE 主要是低质量数据是公开的秘密,但缺乏量化模仿学习数据质量的方法。
上下文学习(In-Context Learning)
LLM/VLM 的成功让人期待 VLA 的上下文学习能力,但几乎没找到相关工作。语言单独为复杂物理任务提供的上下文有限。这可能是实现更好提示和零样本任务泛化的关键。
启示与思考
这篇文章的价值在于它提供了一个"insider's view"——不是站在外部总结论文,而是站在研究一线指出问题。以下几点对我特别有启发:
基准饱和是一个信号,不是一个问题。 LIBERO 被"解决"了,说明领域需要新的、更具判别力的评估方法。这类似于 ImageNet 在 2017 年后的状态——继续在 ImageNet 上刷 0.1% 已经没有科学价值了。
零样本泛化是真正的战场。 工业级系统(Gemini Robotics、Pi0.5)在零样本上的表现远超开源系统,但我们在基准上看不到这个差距。这提示我们需要更多像 RoboArena 这样的零样本公平基准。
数据质量 > 模型架构。 尽管 ICLR 2026 有 164 篇 VLA 论文,几乎没有关注数据质量的。这是一个巨大的研究空白——在模仿学习中,数据的质量可能比模型架构重要得多。
对 AI Agent 安全研究的映射: VLA 社区面临的"仿真基准饱和 vs 现实差距"问题,与 AI Agent 安全社区面临的问题高度相似——在受控环境中的安全评估结果,可能完全不反映真实部署场景中的安全风险。
参考链接
- 原文: https://mbreuss.github.io/blog_post_iclr_26_vla.html
- FLOWER 模型 (作者的相关工作)