基于学习的动力学模型综述:机器人操作中的状态表示与控制
A Review of Learning-based Dynamics Models for Robotic Manipulation
动力学模型是机器人操作中规划与控制的核心组件。本文全面综述了基于学习的动力学模型,深入分析了像素、潜在表示、3D粒子、关键点和物体中心五种状态表示的设计权衡,并探讨了它们与运动规划和策略学习的集成方式。文章揭示了结构化先验在样本效率、泛化能力和感知复杂度之间的根本性权衡,为研究者选择适合特定任务的状态表示提供了系统性的指导框架。
论文概览
人类对物理世界有着直觉性的理解——我们能通过多感官信息预测行动如何影响环境。赋予机器人这种"直觉物理"能力,本质上就是要建立能够预测动作效果的动力学模型。传统的基于物理原理的模型虽然泛化能力强,但依赖完整的状态信息,而这在复杂真实场景中往往难以获取。
发表于 Science Robotics 的这篇综述文章,由加州大学圣迭戈分校、斯坦福大学、哥伦比亚大学、Google DeepMind 等顶尖机构的研究者联合撰写,系统性地梳理了基于学习的动力学模型在机器人操作中的研究进展。文章的核心洞察是:状态表示的选择决定了学习系统中的归纳偏置,进而从根本上影响模型的样本效率、泛化能力和任务适用性。
文章提出了一个统一的 POMDP 框架来分析学习动力学模型的三个核心组件:感知模块(从原始传感数据中估计环境状态)、动力学模块(预测状态转移)、控制模块(生成动作序列)。这种模块化视角使得研究者能够独立分析各组件之间的相互影响和设计权衡。
核心创新
本文最大的贡献在于提出了一个状态表示的分类学框架,将现有方法按照结构化程度分为五个层次,形成一个从非结构化到高度结构化的连续谱系:
像素表示(Pixels) 是最直接的表示方式,将 RGB-D 感知数据作为状态。这类方法可以建模任意的物理现象,但需要大量数据,且容易产生时序不一致的 "幻觉"。代表性工作包括 Visual Foresight、UniSim 和基于扩散模型的视频预测方法。
潜在表示(Latent) 将高维观测压缩到低维潜在空间,引入了"状态空间存在紧致平滑参数化"的归纳偏置。训练方法分为基于重建(如变分自编码器)和免重建(如对比学习、逆动力学预测)两大类。RSSM 等概率模型还能捕捉预测中的不确定性。
3D 粒子表示(Particles) 显式编码三维几何结构,使用图神经网络或卷积架构捕获粒子间局部相互作用。这类模型特别适合可变形物体操作,如 RoboCraft 和 DPI-Nets 在面团塑形、材料切割等任务中展现了强大的建模能力。
关键点表示(Keypoints) 相比粒子更稀疏紧凑,专注于任务相关的语义点。kPAM、Dense Object Nets 等工作推动了关键点检测的自动化,而零样本方法(如利用 CLIP 和 DINO 特征)进一步降低了对人工标注的依赖。
物体中心表示(Object-centric) 最高层次的抽象,将场景建模为离散物体的交互。O2P2、OP3、NS-DR 等方法通过物体分割或无监督物体发现来获取结构化编码,支持对多物体组合的泛化推理。

方法论
文章采用了一种系统化的比较分析方法,围绕"状态表示"这一核心维度展开:
感知模块设计在很大程度上由所选的状态表示决定。像素方法几乎不需要显式感知管线,而粒子表示需要时序一致的点云跟踪,物体中心方法则依赖实例分割或逆渲染技术。这种"感知负担"的差异直接影响系统的端到端效率和部署可行性。
动力学学习与状态表示紧密耦合。图神经网络天然适合粒子化的状态(如 GNS、DPI-Nets),卷积架构计算效率较高但灵活性不足,MLP 适合低维的关键点或潜在状态。Transformer 和扩散模型为像素空间建模提供了更强大的可扩展性。
与控制的集成分为两大范式:运动规划(包括路径规划和轨迹优化)和策略学习。轨迹优化方法如 CEM、MPPI 直接利用动力学模型模拟和评估候选动作序列;策略学习则通过仿真交互数据训练从观测到动作的映射。在线系统辨识技术进一步提升了模型对未知物理参数的适应性。
文章还提出了选择状态表示时需要考量的六个关键维度:建模能力、样本效率、泛化能力、任务对齐、可解释性和计算成本,为实践者提供了明确的决策参考框架。

实验结果
文章以综述的形式汇总了大量代表性工作的结果,覆盖了四大类操作任务:
物体重定位是最基础的测试场景。Visual Foresight 在物体推送任务中验证了像素空间模型的可行性,而基于关键点的 kPAM 和基于物体中心的组合 NeRF 方法在高精度操作中表现更优。样本效率方面,结构化表示(粒子、关键点)通常只需数小时 GPU 训练,而非结构化表示需要更大规模的数据集。
可变形物体操作是动力学建模最具挑战性的场景之一。RoboCraft 和 RoboCook 展示了粒子 + GNN 方案在处理弹塑性物体(如面团、绳索、布料)方面的效果。在线系统辨识在 RoboPack 中被证明能有效应对不同物理属性的未知物体。
多物体操作中考验了模型的组合泛化能力。物体中心方法在目标任务中表现最佳,而像素方法在接触丰富的多物体交互中仍然存在物理一致性问题。RoboPack 集成了触觉传感与粒子动力学模型,实现了密集装箱等复杂任务。
工具使用拓展了机器人的能力边界。粒子表示提供了统一的框架来同时建模物体、工具和机器人末端执行器。RoboCook 成功展示了使用擀面杖、模具等多种工具的长时程操作。
启示与思考
这篇综述为具身智能领域提供了几点深刻的启示:
结构化先验是双刃剑。 更强的归纳偏置带来更高的样本效率和泛化能力,但也增加了感知负担和系统复杂性。未来的关键不在于寻找"最优"的表示,而在于根据任务需求、计算资源和感知能力做出知情的选择。
基础动力学模型(Foundation Dynamics Models) 是一个令人兴奋的前沿方向。当前模型大多局限于狭窄的任务域,缺乏大规模真实世界的带动作标签数据集。从互联网视频中推断潜在动作、利用基础模型的常识物理推理能力来提供先验,都是值得探索的路径。
分层动力学建模可能是应对长时程任务的突破口。人类在执行复杂任务时会在不同抽象层次上进行规划——高层关注子目标,低层关注精细运动控制。构建空间上(从粒子到物体)和时间上(从瞬时转移到技能执行)的分层动力学模型,并与分层规划框架集成,是一个极具前景的方向。
仿真到现实的差距仍然是核心挑战。虽然学习模型可以直接从真实数据中捕捉物理过程来弥合这一差距,但在接触丰富的场景中如何保证预测的鲁棒性仍是未解难题。不确定性量化与理论规划保证的结合是迈向可靠部署的关键一步。
多模态感知融合为增强状态估计提供了新维度。触觉、音频等非视觉模态包含互补的物理交互信息,但模态间统计分布的差异和采样频率的不匹配给统一建模带来了独特挑战。
总体而言,这篇综述为学习动力学模型的研究和实践提供了迄今最系统的地图。随着 VLA(Vision-Language-Action)模型和世界模型研究的兴起,理解动力学学习的核心权衡变得更加重要——因为这个世界最终需要被建模,而如何建模(用什么样的表示、什么样的归纳偏置)将决定机器人系统能走多远。