Skip to main content
2025Annual Review / arXiv 2408.03539

深度强化学习在机器人中的真实世界成功

Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes

来自 UT Austin、UVA 和 Sony AI 的 48 页综述,以真实世界成功为唯一筛选标准,系统评估了 DRL 在四足/双足运动、四旋翼飞行、操纵和导航等领域的成熟度。论文提出了从 L0 到 L5 的六级成功等级分类法,并识别了 PPO、域随机化、特权学习等广泛适用的关键技术。

Chen Tang, Ben Abbatematteo, Jiaheng Hu, Rohan Chandra, Roberto Martín-Martín, Peter Stone
AI解读强化学习机器人

import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'

论文概览

这篇综述区别于其他 DRL 综述的核心特色在于其严格的筛选标准——只纳入在真实世界中至少展示过某种程度成功的 DRL 方法。这个标准听起来简单,但在 DRL 文献中却是一次及时的矫正——大量论文在仿真环境中取得了令人瞩目的结果,但在迁移到真实世界时表现糟糕。

来自 UT Austin、UVA 和 Sony AI 的团队提出了一个创新的四维分类法:

  1. 机器人能力类别:移动性、操作、多智能体交互
  2. 问题形式化:RL 问题如何被抽象和建模
  3. 解决方案方法:使用的具体 DRL 算法和技术
  4. 真实世界成功等级:从 L0 到 L5 的六级成熟度评估

论文以 48 页的篇幅覆盖了 200+ 篇参考文献,对每个机器人能力类别都提供了详细的技术分析和成功案例评估。

六级成功等级分类法

论文提出的成熟度评估框架是其最独特的方法论贡献:

  • L0 - 仅仿真验证:只在仿真环境中测试,无真实世界结果
  • L1 - 有限实验室条件:在受控的单一实验室环境中验证
  • L2 - 多样实验室条件:在多种实验室设置下验证,但仍远离真实世界复杂性
  • L3 - 受限真实世界条件:在真实世界中但受控条件下测试(如特定工厂车间)
  • L4 - 多样真实世界条件:在各种真实世界环境中展现鲁棒性
  • L5 - 商业化部署:集成到商业产品中并被实际使用

这个分类法不仅用于评估成熟度,更重要的是揭示了不同能力领域之间的巨大差异——四足运动控制已经达到 L4-L5,而双足运动和通用操作仍主要停留在 L1-L2。

移动性:DRL 最成功的领域

四足运动控制

四足机器人运动控制是 DRL 在真实世界中取得的最显著成功。论文汇总了 30+ 篇在真实四足机器人上验证过的 DRL 方法,覆盖从基础的平地行走到复杂的越障、跳跃和摔倒恢复。

关键技术洞察包括:

  • 特权学习:先用具有完整地形信息的"特权"策略进行训练,再蒸馏到仅依赖真实传感器输入的学生策略——这是处理地形不可观测性的标准范式
  • 课程学习:逐步增加任务难度(从平地到阶梯到碎石地),使训练过程更稳定
  • Sim-to-Real 迁移:通过注入模拟传感器噪声、后处理深度图像、自监督学习视觉编码器等方法缩小仿真-现实差距
  • PPO 的主导地位:由于对超参数的鲁棒性,PPO 是四足运动控制中使用最广泛的 RL 算法

ANYbotics 和 Boston Dynamics 等公司的产品中已经集成了 DRL 控制器,达到了 L5 成熟度——这是 DRL 在机器人中最接近产业化的应用。

双足运动控制

相比四足机器人,双足运动的 DRL 进展更有限,真实世界展示的技能也更为基础。双足机器人面临的关键挑战在于非静态稳定的动力学特性——连基本的站立和行走都比四足机器人困难得多。论文指出,多数双足 DRL 方法仍然依赖基于模型的参考步态来辅助强化学习。

四旋翼飞行控制

四旋翼飞行器的 DRL 控制展示了一些令人印象深刻的成功案例,包括冠军级无人机竞速。但安全性约束在飞行领域比地面运动更为严格,限制了更广泛的实际部署。

操作:DRL 仍需突破的领域

与运动控制相比,DRL 在机器人操作中的真实世界成功更为有限。主要挑战包括:

  • 高维动作空间:灵巧操作的关节配置空间极其复杂
  • 精密接触建模:抓取、插入等任务需要精确的接触动力学,仿真中难以准确建模
  • 稀疏奖励:操作任务的完成信号往往稀疏且延迟

论文观察到,在操作领域最成功的方法往往是 DRL 与模仿学习的结合——先用人类演示初始化策略,再用 RL 进行精细化。

多智能体交互

人机交互和多机器人协作是 DRL 应用最不成熟的领域。人类行为的高度不确定性、安全约束的严格性以及多智能体 RL 固有的大规模探索需求,使得这些问题在真实世界中的 DRL 解决仍然十分初步。

启示与思考

这篇综述的务实立场给了我深刻印象。在 DRL 研究中,仿真结果的"过度乐观"是长期问题——在 Atari 或 MuJoCo 上取得的最新 SOTA 通常不代表真实机器人上的突破。论文通过将"真实世界成功"作为核心筛选标准,为这个领域注入了一剂清醒的现实主义。

从安全角度而言,论文揭示的成熟度不平衡(运动控制远优于操作)具有重要的安全含义。这意味着我们可以对基于 DRL 的运动控制器的安全性相对有信心(因为经过了广泛真实世界验证),但对基于 DRL 的操作策略则应保持更多审慎。

论文提出的 L0-L5 成熟度框架也为 AI 安全评估提供了一个有价值的参考模型。在对 AI 系统进行安全认证时,我们不仅需要了解系统的能力,更需要系统化地评估其部署成熟度——系统在何种程度上经过了超出实验室条件的验证?这个维度在当前的 AI 安全讨论中往往被忽视。

参考链接