面向物体中心机器人操作的具身学习综述
A Survey of Embodied Learning for Object-Centric Robotic Manipulation
这篇综述聚焦物体中心机器人操作中的具身学习,将其分为具身感知学习、具身策略学习和具身任务导向学习三大分支,系统梳理了基于图像/3D/触觉的数据表示、物体姿态估计、可供性学习、显式/隐式/扩散策略、强化/模仿学习,以及物体抓取与灵巧/非灵巧操作等方向。
import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'
论文概览
《A Survey of Embodied Learning for Object-Centric Robotic Manipulation》由香港理工大学、清华大学、香港中文大学的研究者联合撰写。这篇综述的独特之处在于其聚焦"物体中心"的机器人操作任务,将具身学习按照感知—策略—任务三个层面进行系统组织。
与传统机器学习方法依赖静态数据集不同,具身学习强调通过与环境的物理交互和感知反馈来获取知识。这对于机器人操作尤为重要,因为操作任务涉及多样化的物体、复杂的环境不确定性以及实时性要求。
作者团队建立了配套项目页面 [OCRM survey](https://github.com/RayYoh/OCRM survey),持续收集相关资源。
核心创新
论文提出了一个清晰的三层分类框架:
- 具身感知学习(EPEL):通过图像、3D 信息或触觉数据理解物体和环境,包括数据表示、物体姿态估计和可供性学习。
- 具身策略学习(EPCL):基于感知信息生成机器人决策,涵盖显式/隐式/扩散策略表示,以及强化学习、模仿学习等训练方法。
- 具身任务导向学习(ETOL):面向具体任务优化执行过程,包括单物体/多物体抓取和非灵巧/灵巧操作。

方法论
具身感知学习
感知是机器人操作的基础。论文从三个维度展开:
数据表示
- 基于图像的表示:直接从 RGB/RGB-D 图像中提取特征,计算高效但缺乏显式 3D 几何信息。
- 3D 感知表示:利用点云、体素、NeRF 或 3D Gaussian Splatting 捕捉物体几何结构,更适合精确的空间推理。
- 触觉表示:通过触觉传感器获取接触信息,弥补视觉在遮挡和精细接触建模上的不足。
物体姿态估计
- 实例级姿态估计:针对已知物体预测 6-DoF 姿态。
- 类别级姿态估计:对同一类别的新实例进行泛化。
- 新物体姿态估计:在完全没有见过的物体上估计姿态,是更具挑战性的开放问题。
可供性学习(Affordance Learning)
可供性学习帮助机器人理解物体的功能区域和潜在交互方式。论文区分了两种范式:
- 监督学习方法:如 AffordanceNet、VRB、Robo-ABC、RAM、OpenAD,从静态图像或人类视频中学习可供性。
- 交互学习方法:如 Where2Act、AdaAfford、DualAfford、ActAIM、IDA、RLAfford,通过在仿真环境中主动与环境交互来发现可供性。
具身策略学习
策略学习的目标是让机器人根据感知做出最优动作决策。论文将其分为策略表示和策略学习两个层面。
策略表示
- 显式策略:直接用神经网络参数化映射 πθ: O → A,可以是确定性或随机性。简单高效,但难以表达多模态动作分布。
- 隐式策略:基于能量模型(EBM),将动作预测转化为优化问题,能更好处理多模态分布。
- 扩散策略:受 DDPM 启发,通过去噪过程生成动作。Diffusion Policy、Decision Diffuser、Diffusion-QL、MDT 等工作表明,扩散模型在机器人操作中能生成平滑且多样的动作序列。

策略学习方法
- 强化学习(RL):如 ViSkill、RMA2、SAM-RL、Offline RL、Text2Reward、EUREKA,通过与环境交互优化策略。
- 模仿学习(IL):如 DMPs、DAgger、SpawnNet、ACT,从专家演示中学习。MimicGen、BridgeData、Open X-Embodiment 等数据集推动了模仿学习的规模化。
- 其他方法:包括 RL 与 IL 的结合(UniDexGrasp、UniDexGrasp++),以及 LLM/VLM 驱动的方法(VILA、Grounding-RL、OpenVLA、3D-VLA)。
具身任务导向学习
物体抓取
- 单物体抓取(SOG):研究如何稳定抓取单个物体,包括静态抓取、杂乱环境中的抓取、动态物体抓取和人机交接。
- 多物体抓取(MOG):要求机器人一次操作周期内抓取多个物体,需要考虑物体间的摩擦、空间排列和协调控制。
物体操作
- 非灵巧操作(NDM):使用夹爪、吸盘、推杆等简单末端执行器完成 pick-and-place、推/拉、整理、装配等任务。
- 灵巧操作:使用多指手进行更复杂的操作,如衣物折叠、绳索操作、铰接物体(门、抽屉)操作、手持物体重定向等。
实验结果
综述通过横向比较揭示了以下趋势:
-
3D 感知表示显著提升空间精度:在需要精确几何推理的任务中,基于点云或 NeRF 的方法通常优于纯 2D 方法。
-
扩散策略正在改变动作生成范式:相比传统的回归策略,扩散策略能更好表达"同一状态下多个合理动作"的多模态特性,在精细操作任务上表现更佳。
-
多模态数据融合是趋势:结合视觉、触觉、力觉和语言信息,能够提升机器人在遮挡、动态变化和复杂交互场景中的鲁棒性。
-
从仿真到现实的迁移仍是核心挑战:尽管域随机化、物理约束正则化和自训练等方法取得了进展,但 Sim-to-Real 差距仍然是限制实际部署的主要因素。
启示与思考

这篇综述让我对"物体中心"的机器人操作有了更系统的理解。几个值得关注的未来方向:
Sim-to-Real 泛化
仿真环境安全、可控、可规模化,但真实世界存在感知差异、控制器不准确和仿真偏差。如何缩小这一差距,是具身学习走向实用的关键。未来的方向包括更真实的物理仿真、系统化的域随机化、以及基于真实反馈的迭代自训练。
多模态具身大模型
人类依赖视觉、听觉、触觉等多模态感知完成任务。多模态 LLM 为机器人提供了强大的推理和知识整合能力,但如何将这些能力与物理动作精确结合,仍需要大量研究。特别是触觉和力觉等模态,在现有 VLA 中利用不足。
人机协作
机器人不应孤立工作,而应与人类协同。如何理解人类意图、预测人类行为、确保交互安全,是实现真正智能机器人的重要课题。目前的许多方法仍在仿真或有限任务中验证,距离实际应用还有距离。
模型压缩与实时推理
RT-2 的决策频率仅 1-5 Hz,难以满足实时控制需求。Figure 01 展示 200 Hz 的动作生成能力,说明模型压缩和高效网络架构的重要性。未来需要在保持模型能力的同时,大幅提升推理速度和能效。
可解释性与安全性
深度学习模型常被视为"黑箱",这在与人密切接触的机器人应用中尤其令人担忧。提高模型可解释性、设计可靠的安全监控机制、进行对抗训练以防御攻击,都是保障机器人安全可信部署的必要条件。
总的来说,这篇综述表明,物体中心机器人操作是一个高度交叉的领域,涉及计算机视觉、强化学习、模仿学习、多模态大模型和机器人学。随着这些技术的融合,我们正逐步接近能够在真实世界中自主、安全、灵活操作的智能机器人。