机器人学习中的世界模型:一份全面的综述
World Model for Robot Learning: A Comprehensive Survey
世界模型(World Model)是机器人学习的核心组件之一。这篇来自 NTU、UC Berkeley、Stanford 等机构的 43 页综述,从 Policy、Simulator、Video Generation 三个维度系统梳理了世界模型在机器人学习中的架构范式、功能角色和应用进展,并重点分析了其与 VLA 策略的耦合关系。
import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'
论文概览
这篇来自 Nanyang Technological University、UC Berkeley、Stanford、Harvard 等顶尖机构的综述,作者阵容包括 Pieter Abbeel、Jitendra Malik、Jiajun Wu 等机器人学习领域的关键人物。论文以 policy-centric 视角,对机器人学习中世界模型的架构设计、仿真应用和视频生成能力进行了系统梳理。
论文的核心贡献有三点:
- 细粒度分类法:区分了世界模型与 VLA 策略的 5 种耦合范式(Decoupled → Single-Backbone → MoE/MoT → Unified VLA → Latent WM)
- 功能性定义:明确世界模型不是"能预测未来的模型",而是"预测结果能为下游决策所用的模型"——强调 action-conditioned consistency
- 全面的实验对比:在 LIBERO、RoboTwin、CALVIN、SIMPLER 四个基准上汇总了代表性方法的结果
这篇综述覆盖了 2023-2026 年初的 50+ 代表性工作,维护了配套 GitHub 仓库持续追踪新进展。
世界模型的核心定义
论文给出了一个我比较欣赏的功能性定义:世界模型不是仅仅预测 plausible future,而是预测 how the future changes under robot-relevant actions。这个区分很重要——一个模型如果生成了好看的视频但不能支撑下游决策,它就不是这篇综述意义上的世界模型。
作者进一步提炼了世界模型的三个核心能力:
- Foresight(预见):在动作执行前预测未来状态或动作后果
- Imagination-driven Planning(想象驱动规划):通过 imagined rollouts 比较和选择候选行为
- Data Amplification(数据增强):合成额外的演示或交互轨迹来提升学习效率
这种功能性视角让我想到 Ha & Schmidhuber (2018) 的经典工作,但这篇综述把它系统化到了机器人策略学习的完整场景中。作者特别强调了一个关键点:action-conditioned consistency(动作条件一致性)——世界模型预测的未来必须忠实于待执行动作的物理后果,而非仅仅与任务意图语义一致。
五大架构范式
这是我认为论文最有价值的部分。作者将 World Model + Policy 的架构设计分为五类,并用 LIBERO 基准的结果验证了每种范式都能达到高水平,说明"条条大路通罗马":
1. Decoupled(解耦式)
早期范式,世界模型先预测未来视频,再用 Inverse Dynamics Model (IDM) 从预测中推断动作。代表工作包括 UniPi、MimicVideo、Say-Dream-ACT。优点是模块化清晰,缺点是预测与动作生成的因果链过长,容易引入累积误差。
2. Single-Backbone(共享骨干)
使用同一骨干网络同时承担未来预测和动作生成任务。代表工作:CosmosPolicy、VideoPolicy、UD-VLA。这种设计通过共享表示增强了预测与控制的耦合。
3. MoE / MoT(混合专家/混合Token)
使用多个专家模型或混合 token 策略来处理不同类型的预测和决策需求。代表工作:Motus、LingBot-VA、BagelVLA。Motus 在 LIBERO 上达到 97.7% 平均成功率,LingBot-VA 更是达到 98.5%。
4. Unified VLA(统一视觉-语言-动作模型)
将世界建模直接融入 VLA 训练目标,不再显式分离预测和动作生成。代表工作:RynnVLA-002、DreamVLA、UniVLA、CoWVLA。RynnVLA-002 通过统一训练策略耦合未来状态预测与动作生成,鼓励策略对齐的预测动力学。
5. Latent World Modeling(隐空间世界建模)
在隐空间而非像素空间进行世界建模,回避了完整视频生成的高昂成本。代表工作:VLA-JEPA、JEPA-VLA、WoG。这类方法的优势在于效率——不需要 photo-realistic 视频生成就能支持有效决策。
世界模型作为仿真器
论文的另一条主线是世界模型如何从"辅助预测器"进化为"学习环境":
- Validation 阶段(2024-2025):世界模型用于验证候选动作,如 IRASim、WorldEval
- RL & Post-Training 阶段(2025 中):世界模型作为可学习的 RL 环境,如 VLA-RFT、DiWA、Giga-Brain-0.5M
- Co-Optimization 阶段(2025 末-2026):世界模型与策略协同进化,如 WorldVLA-Loop、PlayWorld、DreamPlan
这种演进反映了世界模型正在从"辅助工具"变为"核心学习基础设施"。
实验结果全景
论文在 LIBERO 4-Suite 基准上汇总了 10+ 方法的结果。
LIBERO Benchmark 结果(按架构分组):
| 分组 | 方法 | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|---|
| Decoupled | Say-Dream-ACT | 99.4 | 99.2 | 98.6 | 95.4 | 98.1 |
| Single-BB | CosmosPolicy | 98.1 | 100.0 | 98.2 | 97.6 | 98.5 |
| MoE/MoT | LingBot-VA | 98.5 | 99.6 | 97.2 | 98.5 | 98.5 |
| MoE/MoT | Motus | 96.8 | 99.8 | 96.6 | 97.6 | 97.7 |
| Latent WM | VLA-JEPA | 96.2 | 99.6 | 97.2 | 95.8 | 97.2 |
| Unified VLA | RynnVLA-002 | 99.0 | 99.8 | 96.4 | 94.4 | 97.4 |
三个关键洞察:
- Long-horizon 是真正的分水岭:所有方法在 Spatial/Object 上表现接近,但 Long suite 上分化明显(87.0% - 98.5%)
- Photo-realistic 视频不是必需的:Latent WM 方法(VLA-JEPA、WoG)不需要生成高质量视频就能达到竞争力水平
- 跨基准泛化仍困难:在 RoboTwin 上的强方法不一定在 CALVIN 上表现好,说明 embodiment gap 依然显著
8 大挑战与未来方向
论文最后总结了 8 个开放挑战,我挑 4 个最有深度的讨论:
Causal Conditioning Gap
当前 VLA 框架中,世界模型预测的未来可能更多依赖于历史上下文和任务意图,而非具体的待执行动作。这导致 causal misalignment:生成的视频看起来合理,但物理上不一定和动作一致。WorldVLA 尝试通过统一训练来缓解这个问题。
多模态感知瓶颈
现有世界模型严重依赖视觉,但许多重要物理属性(摩擦、刚度、接触稳定性)无法从视觉中推断。论文提出整合触觉传感和力反馈是解决的关键路径,但这涉及异步信号对齐的技术难题。
符号结构整合
像素级预测在长期规划中会累积误差。符号世界模型(基于对象、关系、谓词)通过抽象化低层细节来支持更可靠的长期推理。论文认为 hybrid world models——结合学习得到的感知表示与符号结构——是最有前景的方向。
评估指标缺失
Embodied world models 缺乏公认的评估指标。视觉保真度高不等于决策效用强,反之亦然。论文提出评估应是多维的——预测质量、下游控制效用、物理可执行性。
启示与思考
这篇综述的意义超出了单纯的文献整理。它揭示了机器人学习中一个正在发生的范式转移:世界模型正在从外围辅助模块变为核心决策基础设施。
对 AI Agent 安全研究而言,这里面有直接的映射关系。Agent 行为安全的本质问题是:agent 是否能预测其行动对环境的真实影响?如果世界模型存在 causal conditioning gap(预测看起来合理但物理不一致),那么基于世界模型的 safety verification 也会存在盲区。这让我想到了 AISpec 项目中形式化方法在 AI 代码生成中的应用——如果我们要在 agent 层面做形式化验证,可能也需要一个足够精确的"世界模型"作为环境抽象。
另一方面,Latent World Modeling 的思路也值得注意:不追求像素级预测,而是在隐空间学习预测表示。这对安全监控系统(如 AgentMoss)的设计有启发——也许我们不需要完整模拟 agent 行为的所有维度,只需要在关键的安全相关维度上做准确预测就够了。
最后,论文中反复强调的 action-conditioned consistency 可能是机器人学习与 AI Agent 安全交叉点上的关键概念。当我们评估 agent 行为的安全性时,核心问题不是"这个行为在语义上是否合理",而是"这个行为的实际物理后果是否安全"。