Skip to main content
2025arXiv 2507.01925 / PKU-PsiBot

VLA 模型综述:动作 Token 化视角

A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

来自北京大学 PKU-PsiBot 联合实验室的 70 页重磅综述,提出以动作 Token 化为统一框架理解所有 VLA 模型。论文将动作 Token 分为八类——语言描述、代码、可供性、轨迹、目标状态、隐表示、原始动作和推理——并深入分析了各自的优劣与协同关系,是理解 VLA 领域全貌的必读之作。

Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xuchuan Huang, Zhang Chen, Xiaowei Zhang, Yuanfei Wang, Shaoyang Guo, Tianrui Guan, Yuanpei Chen, Yaodong Yang
AI解读VLA具身智能动作Token化

import { resolveImageSrc } from '@/components/PaperMarkdownRenderer'

论文概览

这篇来自北京大学 PKU-PsiBot 联合实验室的综述是近期 VLA 领域最全面、最具洞察力的文献之一。以 70 页的篇幅覆盖 400+ 篇参考文献,论文的最大贡献在于提出了一个极具解释力的统一框架——以**动作 Token 化(Action Tokenization)**为核心视角,将看似千差万别的 VLA 模型统一到同一个概念体系下。

论文的核心创新可以概括为三点:

  1. 动作 Token 统一框架:将 VLA 模型视为"视觉和语言输入 → VLA 模块逐步处理 → 动作 Token 链逐步细化 → 最终可执行动作"的管道。动作 Token 是 LLM 中语言 Token 的广义对应物——这是理解整个框架的关键类比。

  2. 八类动作 Token 的系统分类:语言描述、代码、可供性(Affordance)、轨迹、目标状态、隐表示、原始动作和推理。每类都有详尽的优劣势分析和代表工作梳理。

  3. VLA 演进路线图:从 VLA 模型到 VLA Agent 的跨越、从模仿学习到强化学习的扩展、从线性到有向图的架构拓扑跃迁——论文描绘了一幅清晰的领域演进蓝图。

对于希望深入理解 VLA 模型设计空间的读者而言,这篇综述的价值远超一般的文献整理——它提供了一个可以用于分析和设计新 VLA 架构的概念工具包。

核心创新:动作 Token 化的统一视角

论文观察到,尽管 VLA 模型的外在形式千差万别——有的生成语言计划,有的预测关键点,有的直接输出关节角度——但它们都可以被抽象为同一个过程:VLA 模块处理输入并生成动作 Token 链,每一步的 Token 都比上一步编码了更接地气、更可执行的信息。

动作 Token 是这篇论文的核心概念。 它被宽泛地定义为"VLA 模型中任何逐步生成的动作相关指导信息",包括但不限于:

  • VLA 模块的输出(如语言子任务描述)
  • 可微分子网络中的语义有意义的中间生成(如可供性热力图)
  • 不可微功能单元的产物(如运动规划器生成的轨迹)

这种宽泛定义的好处在于包容性——无论是 Hi Robot 中 "make a sandwich" 这样的语言计划,VoxPoser 中的 3D 可供性地图,还是 π₀ 中直接输出的关节角度序列,都在这个框架下被统一为不同粒度的动作 Token。

更重要的是,论文将 VLA 的动作 Token 与 LLM 的语言 Token 做了直接类比。LLM 通过自回归生成语言 Token 来实现文本理解和生成,VLA 通过逐步生成动作 Token 来实现场景理解到物理执行的映射。这种类比不仅优雅,而且暗示了 VLA 可以沿用 LLM 的大量训练基础设施和扩展定律。

八大动作 Token 深度解析

语言描述(Language Description)

语言描述是 VLA 中使用最广泛的 Token 类型,进一步分为语言计划(Language Plan)和语言运动(Language Motion)。语言计划(如"先去厨房,拿起杯子,装满水")受 LLM 支持最好,是实现长时序任务分解的天然选择,但其表达能力有限——很难用自然语言精确描述精细灵巧的操控动作。语言运动(如直接输出运动参数文本)面临同样的问题。论文的判断是:语言运动不太可能成为主流,而语言计划将保持其作为任务分解基础工具的地位。

代码(Code)

代码 Token 是自然语言的强大替代方案。Code-as-Policies 框架展示了 LLM 生成 Python 代码来编排感知 API 和运动原语的威力。代码天然支持逻辑控制、循环和数学运算,表达能力远超纯自然语言。但代码方案过于依赖预定义的 API 函数库,限制了在未知场景中的灵活性。论文认为,代码 Token 的潜力将在建立连接感知与动作原语的综合性函数库后得到充分释放。

可供性(Affordance)

可供性 Token 编码了"在哪里交互"的信息,包括关键点、边界框、分割掩码和可供性热力图。VoxPoser 使用 LLM 和 VLM 生成 3D 可供性图,再由运动规划器转换为动作。ReKep 通过关键点约束进行精确交互。可供性天然地擅长语义锚定——它直接告诉机器人"抓这里"而不是"某种抓取姿势"。但当前的可供性方法对视觉噪声(遮挡、运动伪影)敏感,且缺乏对可供性随时间变化的时间建模。

轨迹(Trajectory)

轨迹 Token 编码了"如何移动"的路径信息。RT-Trajectory 的"轨迹草图"方法通过提供 2D 轨迹作为运动引导,显著增强了策略的泛化能力。轨迹的一个重要优势是可以用非机器人领域的人类视频进行训练,支持跨任务泛化。但与可供性相反,轨迹普遍缺乏语义基础——一条在空间中的曲线本身不携带"为什么要这样移动"的信息。

目标状态(Goal State)

目标状态 Token 以图像或视频的形式描述"任务完成后应该是什么样子"。VPP(Video Prediction Policy)等方法通过扩散模型生成目标图像作为条件来引导动作生成。目标状态 Token 有独特的数据可扩展性——可以通过后见之明重标记(hindsight relabeling)和利用无动作标注的视频来训练。但其生成高质量、一致的目标状态仍然具有挑战性,且推理延迟较高。

隐表示(Latent Representation)

隐表示 Token 是最有潜力的方向之一,也是最具挑战性的。GO-1 和 OmniJARVIS 等方法在隐空间建模状态表示,避免了显式 Token 生成的瓶颈。隐表示天然支持跨实体数据共享和无监督学习,但完全不可解释,且需要仔细设计的训练策略来确保隐空间的对齐和粒度的适当性。

原始动作(Raw Action)

原始动作是最直接的 Token 类型——直接输出关节角度、末端执行器位姿等。RT-2 将动作离散化为 Token 进行自回归预测,π₀ 使用流匹配生成连续动作序列。原始动作需要最少的人类知识介入和 Token 标注,且可以直接沿用 VLM 的训练策略。但其最大的瓶颈是数据——足够的多样化机器人操作数据极为稀缺。

推理(Reasoning)

推理被定位为元 Token——它不直接编码物理动作信息,而是增强其他所有 Token 类型的生成质量。从 CoT-VLA 的语言链式推理到可感知动作的推理(整合多模态反馈),再到自适应测试时计算分配(如 o1/R1 风格),推理正在从纯语言形式向动作感知的形式演进。

从 VLA 模型到 VLA Agent

论文一个高瞻远瞩的判断是:当前 VLA 研究的重心在"模型"而非"Agent"。一个真正的 VLA Agent 不仅需要感知-动作能力(模型提供),还需要更广泛的认知架构——记忆(记住过去的交互)、探索(主动收集经验)、规划(长时序策略编排)和反思(从失败中学习)。

架构拓扑也需要演变:当前大多数 VLA 采用线性处理架构(输入 → 模块 → Token → 执行),而未来的 VLA Agent 需要更复杂的拓扑——双向信息流(执行反馈影响上层规划)、循环结构(迭代优化)、甚至有向图结构(多种信息在多个节点间灵活流动)。

论文还指出了模型-数据-硬件三元协同进化的必要性。当前大多数 VLA 研究局限在简化的实验室环境中(主要是夹爪操作),远未达到真实世界中通用具身 Agent 的要求。硬件平台在灵巧性和鲁棒性方面的不足构成了基础性限制。

启示与思考

这篇综述对我最大的启发是:动作 Token 的设计是 VLA 模型的决定性设计选择。其他设计决策(视觉编码器选择、模型规模、训练策略)都围绕着"如何生成更好的动作 Token"展开。这提供了一个简洁而强大的分析框架。

从安全角度来看,动作 Token 的类型选择直接影响安全性分析的难度。语言描述和代码 Token 具有天然的可解释性——可以在执行前进行安全审查。隐表示 Token 则完全不可解释,使行为级安全验证几乎不可能。可供性和轨迹 Token 处于中间地带——它们可以作为安全约束的锚点(如"这里不能抓""这个轨迹会碰到障碍物")。

论文对 VLA Agent 的愿景也与 Agent 安全研究高度相关。当 VLA 从被动响应模型演变为主动探索的 Agent 时,探索行为本身就会引入新的安全风险。Agent 可能会为了收集经验而尝试潜在危险的动作——这与强化学习中的探索-利用权衡是一脉相承的。

最后,论文强调的安全与对齐问题——"当前 VLA 研究主要关注模型能力,未来必须更加重视安全和人类对齐"——凸显了技术推进与社会责任的张力。在一个模型可以直接操控物理设备的世界里,安全不能是后期修补,而必须从一开始就内建在 Token 设计中。

参考链接