Skip to main content
2025arXiv 2508.10399

大模型赋能具身智能:决策与学习综述

Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning

来自电子科技大学团队的 48 页综述,首次将世界模型纳入具身 AI 调查框架。论文以决策与学习双主线,系统梳理了分层决策和端到端 VLA 两大范式的演进,详细分析了大模型如何增强模仿学习与强化学习,并深入探讨了世界模型在决策仿真与数据生成中的关键角色。

Wenlong Liang, Rui Zhou, Yang Ma, Bing Zhang, Songlin Li, Yijia Liao, Ping Kuang
AI解读具身智能VLA强化学习

import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'

论文概览

这篇来自电子科技大学的综合性综述,以 48 页的篇幅对大型模型赋能具身智能进行了全面梳理。论文最大的特色在于其双重分析框架:横向对比不同范式(分层 vs 端到端、模仿学习 vs 强化学习),纵向追踪核心方法从起源到前沿的演进脉络。

论文的核心贡献有三点:

  1. 首次将世界模型纳入具身 AI 综述框架:世界模型从辅助预测器演变为核心学习基础设施,论文系统梳理了其四种设计架构及在决策与学习中的应用
  2. 分层与端到端两大决策范式的全面对比:从模块化程度、可解释性、推理速度、泛化能力等维度进行了系统比较
  3. 大模型赋能具身学习的深度分析:覆盖扩散模型构建策略网络、Transformer 行为克隆、LLM 辅助奖励函数设计等前沿技术

这篇综述维护了配套 GitHub 仓库,持续追踪领域最新进展,对于希望系统性理解具身 AI 领域发展全貌的研究者而言,是一份极佳的入门与参考材料。

核心创新:双重分析框架

论文采用了独特的横向与纵向双重分析方法,这是我认为最有价值的设计。

横向分析聚焦于范式比较。论文将决策方法分为分层决策与端到端决策两大范式,将学习方法分为模仿学习与强化学习两大路线,逐一对比其在模块化程度、泛化能力、计算效率、可解释性等方面的优劣。这种并排对比的方式让读者能够清晰把握不同技术路线的设计权衡。

纵向分析追踪技术演进。以世界模型为例,论文从传统的 Recurrent State Space Model (RSSM) 出发,追溯了 Transformer 世界模型(IRIS → Genie → TWM → STORM)和扩散世界模型(Sora → UniPi → UniSim)的发展脉络,以及 LeCun 提出的 Joint Embedding Predictive Architecture (JEPA) 范式。这种时间线的梳理让读者理解每种方法产生的历史背景和技术动机。

论文的另一个创新是从具身 AI 的视角审视大模型的赋能作用。与之前以 LLM/VLM 自身为中心的综述不同,这篇论文始终以具身智能体的需求为出发点,分析大模型在感知、规划、执行、学习各个环节中如何发挥作用。

方法论:分层决策与端到端决策

分层决策范式

分层决策将智能体的认知过程分解为三个明确的层次:

高层规划(High-Level Planning):大模型(通常是 LLM)将复杂的自然语言任务指令分解为可执行的子任务序列。论文将规划方式分为三类:

  • 结构化语言规划:生成 PDDL(规划领域定义语言)格式,便于传统规划器执行,代表工作包括 LLM+P、LLV
  • 自然语言规划:直接输出自然语言任务描述,灵活但可能产生不可行计划,代表工作包括 SayCan、Inner Monologue
  • 编程语言规划:生成可执行代码作为规划输出,代表工作包括 Code-as-Policies、ProgPrompt

低层执行(Low-Level Execution):将抽象的子任务翻译为精确的物理动作。大模型通过三种方式增强执行能力:

  • 预定义技能库调用
  • 通过 API 与外部工具交互
  • 直接生成运动轨迹和力控参数

反馈增强(Feedback Enhancement):通过自我反思、环境反馈和人工反馈实现闭环优化。ReAct 框架将推理与执行整合,让智能体在行动前先进行推理,增强了决策透明度。

端到端 VLA 范式

端到端 VLA 模型将感知、推理和动作生成整合到统一框架中。论文对 VLA 模型进行了详细的解构分析:

三大增强方向

  • 感知增强(P):从 2D 图像扩展到 3D 点云(PointVLA)和多模态融合(3D-VLA),提升空间理解能力
  • 动作生成增强(A):从离散 token(RT-2)到扩散策略(Diffusion-VLA)、流匹配(π₀)和混合架构,提升动作精度和连续性
  • 部署效率增强(C):通过模型压缩(TinyVLA)、缓存机制(VLA-Cache)和动态路由(MoLeVLA),使 VLA 能够在边缘设备上实时运行

论文对主流 VLA 模型进行了全面的性能对比表格,涵盖了 RT-2、Octo、OpenVLA、π₀、TinyVLA、MoLeVLA 等关键模型,清晰展示了从 2023 到 2025 年的架构演进趋势。

具身学习:大模型的新角色

模仿学习中的大模型赋能

论文详细分析了两类大型模型在构建策略网络中的应用:

扩散模型策略网络:扩散模型在建模复杂多模态动作分布方面展现了独特优势。Diffusion Policy 以 U-Net 作为去噪网络,以视觉特征和机器人当前状态为条件,预测去噪步骤并生成连续动作序列。3D-Diffusion 进一步通过 3D 点云输入提升空间感知能力,相比 2D 版本显著改善了几何关系理解。

Transformer 策略网络:自注意力机制使 Transformer 能够有效建模状态-动作-目标之间的长程依赖。Google 的 RT-1 首次证明了 Transformer 在机器人控制中的潜力,通过大规模多样化数据集(13 万+ 轨迹)训练实现任务泛化。Mobile ALOHA 则展示了 Transformer 在全移动双人协调操作中的应用,将任务扩展到全身协调的复杂场景。

强化学习中的大模型赋能

奖励函数设计:传统手工设计奖励函数极其困难,容易出现奖励稀疏、奖励黑客等问题。大模型通过自动生成奖励信号(如 L2R)或完整的奖励函数代码(如 Eureka),大幅降低了对人工的依赖。Eureka 利用 GPT-4 从任务描述和环境信息中自动生成稠密奖励函数,并通过自动迭代优化——无需人工反馈——在多个机器人操作和运动任务上表现出色。

策略网络构建:在离线强化学习中,扩散模型(Diffusion-QL)、Transformer(Decision Transformer、Q-Transformer)和 LLM(GLAM、LaMo)分别从不同角度提升了策略的表达能力和泛化性。

世界模型:从辅助到基础设施

将世界模型纳入具身 AI 综述是这篇论文最独特的贡献。论文按架构将世界模型分为四类:

  1. 隐空间世界模型:以 Dreamer 系列为代表,通过 RSSM 在潜在空间中进行预测和规划,在 Dreamer V3 中达到了超越专用算法的水平
  2. Transformer 世界模型:利用自注意力机制建模长程依赖,Genie 展示了通过无监督视频学习生成可交互环境的能力
  3. 扩散世界模型:Sora 和 UniSim 等能直接生成视频预测序列,支持基于语言描述的轨迹可视化
  4. JEPA 预测架构:通过分层规划和自监督学习,在高层表征空间中推理,避免了逐像素生成的高昂成本

在应用中,世界模型扮演两个关键角色:仿真验证(让智能体在虚拟环境中"试错"而不需要真实世界交互)和知识增强(通过预测未来状态丰富智能体的情境理解)。在具身学习中,世界模型通过模拟状态转移和合成数据,极大提升了模型训练的样本效率。

核心挑战与未来方向

论文识别了四个主要挑战,我认为其中两个尤为关键:

具身数据稀缺:尽管已有 Open X-Embodiment 等大规模数据集(包含来自 60+ 实验室的机器人数据),但相比视觉-语言领域的 LAION-5B(57.5 亿图文对),具身数据仍然极为匮乏。论文提出了两条路径:利用世界模型合成数据(SynthER),以及整合人类第一人称视频数据(Ego4D)。核心难点在于人机形态差异导致的动作对齐问题。

持续学习的灾难性遗忘:具身系统需要在开放环境中自主更新知识,同时保持已获得的能力。当机器人在平坦地面上训练好导航能力后,在崎岖地形上的新训练可能毁掉原有的技能。经验回放、正则化技术和数据混合策略是当前的主要缓解方案。

此外,Sim-to-Real 迁移计算效率仍然是阻碍具身 AI 大规模部署的瓶颈。论文指出,未来需要在多模态安全评估、领域随机化和模型压缩等方面取得突破。

启示与思考

这篇综述给我的最大启发是:世界模型正在成为具身智能的核心基础设施。这不仅仅是技术趋势,更是认知范式的转变——从"通过更多交互学习"到"通过更好的模拟学习"。

对于 AI 安全研究而言,世界模型的发展具有双重意义。一方面,更精确的世界模型可以用于安全性验证——在虚拟环境中测试智能体行为的各种后果,识别潜在的安全风险。另一方面,世界模型本身可能存在的因果对齐偏差(预测看起来合理但物理上不一致)也构成了安全盲区。

我特别注意到论文中对 JEPA 范式的强调。LeCun 的思路——在语义层面而非像素层面进行预测——与当前安全监控系统的设计思路有相通之处:也许我们不需要完整模拟智能体行为的所有维度,只需要在关键的安全相关维度上进行准确预测。

大模型赋能具身智能的未来,可能不在于选择分层或端到端中的某一方,而在于两者的有机结合——用分层架构提供可解释性和灵活性,用端到端学习提供效率和全局优化。

参考链接