Skip to main content
2026arXiv

自改进 Agent 系统全景:从基础模型到脚手架的统一分类体系

Self-Improvements in Modern Agentic Systems: A Survey

吉林大学与 KAUST 团队(含 Jürgen Schmidhuber)发布的 97 页综述,将现代自改进 Agent 形式化为 (θ, Σ) 耦合系统,区分基础模型改进(慢回路参数固化)与脚手架改进(快回路结构适应)两条路径,覆盖 2023-2026 年百余项工作,追溯自 1790 年代以来的理论根源,提出六维未来方向。

Zhe Ren, Yimeng Chen, Dandan Guo, Jürgen Schmidhuber
AI解读Self-Improving AgentsAgent 架构设计SurveyMeta-LearningFoundation Models

论文概览

当 ChatGPT 证明了基础模型可以作为通用认知引擎后,一个更深远的问题浮出水面:能否构建一个会自己变好的 Agent? 这不是指简单的 in-context learning 或对话历史累积,而是指系统能够持续地检查、评估并修改自身的底层优化机制和运行逻辑——从提示词到记忆库,从工具接口到模型参数本身。

这篇来自吉林大学和 KAUST 的 97 页综述给出了迄今为止最系统化的回答。通讯作者之一是 Jürgen Schmidhuber——他在 1987 年开创了自引用学习框架,2003 年提出了理论自改进的天花板 Gödel Machine。论文的核心贡献在于提出了一个统一的形式化框架:

Agent = (θ, Σ),其中 θ 是基础模型参数,Σ = (p, m, T, g) 是操作脚手架(提示词、记忆、工具、控制逻辑)。

自改进被形式化为一个自诱导算子 U,它将 Agent 自身执行产生的学习信号转化为对 θ 或 Σ 的持久更新。这一框架将此前分散在"自校正""元提示""自博弈"等不同标签下的工作统一到同一坐标轴上比较,并区分出两条互补的改进路径:

  • 基础模型改进(慢回路):更新 θ,稳定但代价高
  • 脚手架改进(快回路):更新 Σ,快速且可逆

统一分类体系
统一分类体系

核心创新

1. 统一形式化与双路径分类

论文最关键的贡献是给出了自改进 Agent(SI-FMA)的严格定义。Agent 在时间步 t 的配置为:

At=(θt,Σt),Σt=(pt,mt,Tt,gt)A_t = (\theta_t, \Sigma_t), \quad \Sigma_t = (p_t, m_t, T_t, g_t)

自改进算子 UU 将执行阶段和更新阶段分离:

At+1=U(A1:t,E(πθt,Σt;Σt,Ct))A_{t+1} = U\left(A_{1:t}, \mathcal{E}(\pi_{\theta_t, \Sigma_t}; \Sigma_t, C_t)\right)

其中 E\mathcal{E} 是 Agent 执行的策略过程,产生学习信号(轨迹、反思、批评、编辑建议)。这个公式有两个精妙之处:一是 Σt\Sigma_t 作为 E\mathcal{E} 的显式参数,允许 Agent 直接"自省"(如审查提示词模板、审计工具配置);二是区分了两种自引用模式——分布级(通过自生成数据影响未来参数)和动作级(直接编辑脚手架组件)。

在这一定义下,基础模型改进和脚手架改进分别对应不同时间尺度和可逆性:

维度基础模型改进 (θ)脚手架改进 (Σ)
时间尺度慢(小时-天)快(秒-分钟)
可逆性低(回滚需检查点)高(直接撤销编辑)
泛化性跨域迁移强上下文相关
代价高(GPU/TPU 计算)低(文本操作)
更新方式梯度下降搜索/生成/符号编辑

2. 技能作为可复用算子

论文提出了一个跨切割概念——技能(Skill)。技能被定义为"自诱导更新算子 U 的可复用实例":一个被保留和复用的、对 Agent 配置 AtA_t 的命名更新。技能的身份是它编码的更新,而非存储位置。一个技能可以序列化到任意基底——工具(T)、指令(p)、记忆条目(m)、固化权重(θ)或控制逻辑(g)。

论文进一步区分了两种作用域:

  • 对象级技能:作用于任务/世界状态(如学习到的"收集木材"例程),是层次化 RL 中时间扩展选项的 Agent 类比
  • 元级技能:作用于 Agent 自身配置 AtA_t(如编写新工具、重构提示词、将经验固化到记忆),是自改进的核心

这一概念框架解释了为什么"技能库"在不同基底中反复出现——它在工具路由和记忆组织中共享相同的"存储-检索"结构。

3. 历史脉络的完整追溯

历史时间线
历史时间线

论文不只是罗列最新工作,而是从 1790 年代的最小二乘法开始,梳理了五条历史脉络:

  1. 早期概念(1790s-1960s):自复制自动机、图灵的"儿童机器"、Ashby 的稳态理论
  2. 符号主义(1960s-1980s):Lenat 的 AM/EURISKO 将启发式规则本身作为可操作对象;Schmidhuber 1987 年的自引用学习框架使"学习过程本身"成为搜索对象
  3. 连接主义(1980s-2000s):快速权重编程(FWP)、Success-Story Algorithm 引入增量自改进和回溯机制
  4. 形式化(2000s-2020s):Gödel Machine(2003)作为理论天花板——当且仅当能数学证明某修改提升期望效用时才执行;反射式预言机和逻辑归纳处理自引用不确定性
  5. 基础模型(2020s-至今):自然语言作为统一语义介质,大幅缩小了可行修改的搜索空间

这条线索揭示了一个核心转变:从低级权重/汇编代码搜索到自然语言语义空间搜索,这是 FM 时代自改进得以扩展的根本原因。

方法论详解

基础模型改进的三类信号

论文将参数更新的学习信号分为三类(对应 Section 5 的三个子节):

内生生成演示(Intrinsic Generative Demonstrations):Agent 同时扮演数据生成者和学习者。核心挑战是模型坍缩——递归训练自生成语料会放大偏差,形成负反馈循环。安全措施包括保留人工基准数据累积叠加(Gerstgrasser et al., 2024)、使用定理证明器验证推理(Leang et al., 2025),以及从大规模离线生成转向不确定性驱动的测试时适配(TT-SI, Acikgoz et al., 2025)。

内生评价反馈(Intrinsic Evaluative Feedback):Agent 构建自己的监督信号——标量奖励、偏好对或批评。代表性工作从 Constitutional AI(Bai et al., 2022)的自我批评到 TTRL(Zuo et al., 2025)的无真实标签强化学习。关键设计选择是查询策略、内在目标和反馈可信赖度。

外生探索经验(Extrinsic Exploratory Experience):Agent 在真实或模拟环境中交互产生轨迹。分为两类:与真实任务环境交互(RoboCat, UI-Genie, Agent-RLVR)和与模拟代理环境交互(世界模型 WebEvolver, GAWM)。这一路径继承了经典 RL 的挑战(稀疏奖励、延迟反馈),同时引入了 FM 特有的新风险——语言级奖励黑客:Agent 可以通过满足验证器的字面条件而非解决底层任务来获取奖励,因为验证器规范本身是语言对象。

脚手架改进的四维分解

脚手架改进不改变模型参数,而是修改 Agent 的操作结构:

提示词优化:从 OPRO 的标量反馈到 TextGrad 的文本梯度方向引导,反馈信号的信息含量逐级丰富——从标量到定性批评,再到种群级选择和结构化方向导数,更新越来越精准。

记忆演化:从静态追加式存储转向主动自组织。论文将记忆分解为三个维度——对象(存储的信息单元)、结构(拓扑组织和索引模式)、处理(创建/读取/更新/遗忘机制),形成一个信号驱动的生命周期循环:观察检测 → 压缩创建 → 组织存储 → 按需检索 → 规划执行 → 评估反馈 → 更新/删除。

工具治理:从静态工具箱转向"工具治理元认知"。三个维度——动态工具路由(何时调用哪个工具)、迭代工具精炼(改进已有工具)、自主工具创建(构建新工具)。代表性工作包括 Voyager 的技能库、STOP 的自引用代码更新。

全脚手架更新:最深层干预——将整个代码库和运行逻辑视为可变基底。ADAS 自动搜索 Agent 架构设计,Gödel Agent 让 Agent 重写自己的推理代码,DGM 在开放搜索空间中探索 Agent 设计变体。

快慢双回路架构与评估框架
快慢双回路架构与评估框架

应用领域

论文 Section 7 覆盖了六大应用域,每个领域因环境反馈特性不同而主导不同的改进路径:

应用领域环境反馈特性主导改进路径代表系统
软件工程编译器/单元测试,密集且可自动化双路径:执行反馈→θ,scaffold→ΣSWE-RL, Live-SWE-Agent, AgentDevel
Web 导航DOM 状态,可模拟FM 改进 + 记忆/工具WebRL, WebGym, UI-Genie
博弈与策略游戏环境,自博弈自博弈 RL (θ)AlphaEvolve, Q-Evolve
科学发现实验工作流,模拟器工具治理 + 全脚手架Stella, AutoTIR
具身 AI机器人模拟器,稀疏奖励RL (θ) + 世界模型RoboCat, WMPO
通用计算机控制虚拟桌面/OS脚手架 + 安全校验MobileGPT, GCC benchmarks

一个关键洞见是:环境反馈的密度和自动化程度决定了改进路径的选择。软件工程因有编译器和测试提供密集可验证反馈,同时支持参数和脚手架两条路径;而通用计算机控制因操作不可逆性,更依赖谨慎的脚手架更新和安全门控。

评估方法论

论文对评估的讨论(Section 8)是整个综述中最具实践价值的部分之一。它将评估从静态零样本打分推向持续轨迹追踪

度量维度

  • 在固定预算下报告完整性能轨迹(而非仅峰值分数)
  • 保持集迁移测试:在不同于优化数据的分布上验证
  • 成本透明度:计算、API token、时钟时间、人工监督的明确分解
  • 稳定性和退化追踪:自修改可能引入回归,需要持续监控

基准分维

  • 机制基准:隔离单一更新通道(如仅提示词、仅记忆、仅工具),在受控环境中测试各机制的边际贡献
  • 领域基准:在真实交互环境中验证端到端改进效果,包括 SWE-bench、WebArena、游戏环境等

论文特别强调了一个容易被忽视的问题:基准特异性过拟合——Agent 可能过度适配特定基准的工具协议、仓库约定或验证器模式,而非获得真正可迁移的能力。应对措施包括基准变异测试和混合回路:仅在脚手架发现能跨验证器迁移时才蒸馏到基础模型。

启示与思考

快慢回路的互补部署策略

论文提出的最具操作性的设计原则是快慢回路分层部署:当环境反馈嘈杂时,先将更新限制在脚手架层(Σ),通过严格的执行测试验证稳定性后,再通过蒸馏或微调将已证明的行为固化到参数(θ)。这是因为参数固化本质上是有损压缩——蒸馏复杂轨迹到神经权重会偏向平均情况执行,往往丢弃探索阶段发现的罕见但关键的错误恢复策略。更重要的是,任何对 θ 的更新都会使先前的安全边界失效,需要重新进行对抗测试。

这启示我,在实践中应该将 Agent 视为一个两阶段系统:快回路负责在部署中持续探索和适应,慢回路负责在离线、受控条件下将验证过的能力固化。这与 SkillOpt 的"验证门"机制和 Cognitive Firewall 的"升级决策"异曲同工——都是通过结构化的接受测试来控制修改的承诺程度。

安全即运行时门控

论文对安全的讨论(Section 9.1)提出了一个直接而有力的观点:自改进 Agent 应被视为在受保护运行时环境中执行的不受信代码。安全不能仅依赖基础模型的初始对齐,而需要分层门控——在任何结构性更新提交到 Σt+1\Sigma_{t+1}θt+1\theta_{t+1} 之前,提议的补丁必须通过验证器门控检查,覆盖功能正确性、工具权限边界和对随机状态扰动的鲁棒性。

这与此前解读的 ActPlane 的设计哲学高度一致——ActPlane 在 OS 层执行策略门控,而论文在此提出的是 Agent 自修改层的门控。两者可以形成纵深防御:ActPlane 在系统调用层拦截不可信行为,而自改进 Agent 的验证器门控在架构更新层拦截不可信修改。

从无状态工具到持续自改进系统

论文结尾的一句话值得深思:"我们应该从构建每次交互后重置的无状态 AI 工具,转向设计能够持续自改进的系统。"这不仅仅是一个技术方向的描述,更是一个范式转变的宣言。

AgentFlow 的静态依赖图分析可以在自改进过程中发现新引入的风险路径——当 Agent 自主创建新工具或修改记忆结构时,ADG 可以追踪这些修改如何改变数据流依赖。而 SkillOpt 的文本空间优化器恰好是论文定义的"元级技能"的一个具体实例——它通过六阶段循环将持续验证过的技能编辑固化到技能库中,同时保持目标模型冻结。

开放问题

论文识别了六个关键未来方向,分为两个主题:

终身适配的算法范式

  1. 测试时持续适配——训练与部署分离的范式需要突破
  2. 主动探索与好奇心——Agent 应主动寻求有价值的经验
  3. 参数蒸馏与联合优化——快慢回路的协同优化

规模化与安全: 4. 安全的自修改架构——验证器门控 + 持续审计 5. 多 Agent 共进化——安全、版本控制的共享工件协议 6. 开放世界分布漂移——非平稳模拟器替代静态排行榜

这些方向共同指向一个核心挑战:如何在持续自改进的同时保持可测量、可归因、安全有界。这不是一个纯技术问题,而是一个需要评估方法论、安全架构和算法范式协同推进的系统工程问题。

参考链接