Skip to main content
2026arXiv 2605.00080

机器人学习中的世界模型:一份全面的综述

World Model for Robot Learning: A Comprehensive Survey

世界模型(World Model)是机器人学习的核心组件之一。这篇来自 NTU、UC Berkeley、Stanford 等机构的 43 页综述,从 Policy、Simulator、Video Generation 三个维度系统梳理了世界模型在机器人学习中的架构范式、功能角色和应用进展,并重点分析了其与 VLA 策略的耦合关系。

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang
AI解读世界模型机器人VLA

import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'

论文概览

这篇来自 Nanyang Technological University、UC Berkeley、Stanford、Harvard 等顶尖机构的综述,作者阵容包括 Pieter Abbeel、Jitendra Malik、Jiajun Wu 等机器人学习领域的关键人物。论文以 policy-centric 视角,对机器人学习中世界模型的架构设计、仿真应用和视频生成能力进行了系统梳理。

论文的核心贡献有三点:

  1. 细粒度分类法:区分了世界模型与 VLA 策略的 5 种耦合范式(Decoupled → Single-Backbone → MoE/MoT → Unified VLA → Latent WM)
  2. 功能性定义:明确世界模型不是"能预测未来的模型",而是"预测结果能为下游决策所用的模型"——强调 action-conditioned consistency
  3. 全面的实验对比:在 LIBERO、RoboTwin、CALVIN、SIMPLER 四个基准上汇总了代表性方法的结果

这篇综述覆盖了 2023-2026 年初的 50+ 代表性工作,维护了配套 GitHub 仓库持续追踪新进展。

世界模型的核心定义

论文给出了一个我比较欣赏的功能性定义:世界模型不是仅仅预测 plausible future,而是预测 how the future changes under robot-relevant actions。这个区分很重要——一个模型如果生成了好看的视频但不能支撑下游决策,它就不是这篇综述意义上的世界模型。

作者进一步提炼了世界模型的三个核心能力:

  • Foresight(预见):在动作执行前预测未来状态或动作后果
  • Imagination-driven Planning(想象驱动规划):通过 imagined rollouts 比较和选择候选行为
  • Data Amplification(数据增强):合成额外的演示或交互轨迹来提升学习效率

这种功能性视角让我想到 Ha & Schmidhuber (2018) 的经典工作,但这篇综述把它系统化到了机器人策略学习的完整场景中。作者特别强调了一个关键点:action-conditioned consistency(动作条件一致性)——世界模型预测的未来必须忠实于待执行动作的物理后果,而非仅仅与任务意图语义一致。

五大架构范式

这是我认为论文最有价值的部分。作者将 World Model + Policy 的架构设计分为五类,并用 LIBERO 基准的结果验证了每种范式都能达到高水平,说明"条条大路通罗马":

1. Decoupled(解耦式)

早期范式,世界模型先预测未来视频,再用 Inverse Dynamics Model (IDM) 从预测中推断动作。代表工作包括 UniPi、MimicVideo、Say-Dream-ACT。优点是模块化清晰,缺点是预测与动作生成的因果链过长,容易引入累积误差。

2. Single-Backbone(共享骨干)

使用同一骨干网络同时承担未来预测和动作生成任务。代表工作:CosmosPolicy、VideoPolicy、UD-VLA。这种设计通过共享表示增强了预测与控制的耦合。

3. MoE / MoT(混合专家/混合Token)

使用多个专家模型或混合 token 策略来处理不同类型的预测和决策需求。代表工作:Motus、LingBot-VA、BagelVLA。Motus 在 LIBERO 上达到 97.7% 平均成功率,LingBot-VA 更是达到 98.5%。

4. Unified VLA(统一视觉-语言-动作模型)

将世界建模直接融入 VLA 训练目标,不再显式分离预测和动作生成。代表工作:RynnVLA-002、DreamVLA、UniVLA、CoWVLA。RynnVLA-002 通过统一训练策略耦合未来状态预测与动作生成,鼓励策略对齐的预测动力学。

5. Latent World Modeling(隐空间世界建模)

在隐空间而非像素空间进行世界建模,回避了完整视频生成的高昂成本。代表工作:VLA-JEPA、JEPA-VLA、WoG。这类方法的优势在于效率——不需要 photo-realistic 视频生成就能支持有效决策。

世界模型作为仿真器

论文的另一条主线是世界模型如何从"辅助预测器"进化为"学习环境":

  • Validation 阶段(2024-2025):世界模型用于验证候选动作,如 IRASim、WorldEval
  • RL & Post-Training 阶段(2025 中):世界模型作为可学习的 RL 环境,如 VLA-RFT、DiWA、Giga-Brain-0.5M
  • Co-Optimization 阶段(2025 末-2026):世界模型与策略协同进化,如 WorldVLA-Loop、PlayWorld、DreamPlan

这种演进反映了世界模型正在从"辅助工具"变为"核心学习基础设施"。

实验结果全景

论文在 LIBERO 4-Suite 基准上汇总了 10+ 方法的结果。

LIBERO Benchmark 结果(按架构分组):

分组方法SpatialObjectGoalLongAvg
DecoupledSay-Dream-ACT99.499.298.695.498.1
Single-BBCosmosPolicy98.1100.098.297.698.5
MoE/MoTLingBot-VA98.599.697.298.598.5
MoE/MoTMotus96.899.896.697.697.7
Latent WMVLA-JEPA96.299.697.295.897.2
Unified VLARynnVLA-00299.099.896.494.497.4

三个关键洞察:

  1. Long-horizon 是真正的分水岭:所有方法在 Spatial/Object 上表现接近,但 Long suite 上分化明显(87.0% - 98.5%)
  2. Photo-realistic 视频不是必需的:Latent WM 方法(VLA-JEPA、WoG)不需要生成高质量视频就能达到竞争力水平
  3. 跨基准泛化仍困难:在 RoboTwin 上的强方法不一定在 CALVIN 上表现好,说明 embodiment gap 依然显著

8 大挑战与未来方向

论文最后总结了 8 个开放挑战,我挑 4 个最有深度的讨论:

Causal Conditioning Gap

当前 VLA 框架中,世界模型预测的未来可能更多依赖于历史上下文和任务意图,而非具体的待执行动作。这导致 causal misalignment:生成的视频看起来合理,但物理上不一定和动作一致。WorldVLA 尝试通过统一训练来缓解这个问题。

多模态感知瓶颈

现有世界模型严重依赖视觉,但许多重要物理属性(摩擦、刚度、接触稳定性)无法从视觉中推断。论文提出整合触觉传感和力反馈是解决的关键路径,但这涉及异步信号对齐的技术难题。

符号结构整合

像素级预测在长期规划中会累积误差。符号世界模型(基于对象、关系、谓词)通过抽象化低层细节来支持更可靠的长期推理。论文认为 hybrid world models——结合学习得到的感知表示与符号结构——是最有前景的方向。

评估指标缺失

Embodied world models 缺乏公认的评估指标。视觉保真度高不等于决策效用强,反之亦然。论文提出评估应是多维的——预测质量、下游控制效用、物理可执行性。

启示与思考

这篇综述的意义超出了单纯的文献整理。它揭示了机器人学习中一个正在发生的范式转移:世界模型正在从外围辅助模块变为核心决策基础设施

对 AI Agent 安全研究而言,这里面有直接的映射关系。Agent 行为安全的本质问题是:agent 是否能预测其行动对环境的真实影响?如果世界模型存在 causal conditioning gap(预测看起来合理但物理不一致),那么基于世界模型的 safety verification 也会存在盲区。这让我想到了 AISpec 项目中形式化方法在 AI 代码生成中的应用——如果我们要在 agent 层面做形式化验证,可能也需要一个足够精确的"世界模型"作为环境抽象。

另一方面,Latent World Modeling 的思路也值得注意:不追求像素级预测,而是在隐空间学习预测表示。这对安全监控系统(如 AgentMoss)的设计有启发——也许我们不需要完整模拟 agent 行为的所有维度,只需要在关键的安全相关维度上做准确预测就够了。

最后,论文中反复强调的 action-conditioned consistency 可能是机器人学习与 AI Agent 安全交叉点上的关键概念。当我们评估 agent 行为的安全性时,核心问题不是"这个行为在语义上是否合理",而是"这个行为的实际物理后果是否安全"。

参考链接