Skip to main content
2026Survey

形式化验证与 AI Agent 结合:工作分类与总结

Formal Verification Meets AI Agents: A Survey and Taxonomy

系统梳理 2025-2026 年形式化验证与 AI Agent 交叉领域的 15 篇代表性工作,按五大研究方向分类:运行时安全约束、语义框架与安全属性、Agent 驱动形式化验证、形式化方法引导多智能体学习、愿景与挑战。揭示「反馈质量大于验证能力」「行为漂移是本质属性」「多 Agent 可靠性乘积退化」等关键洞察。

AI解读形式化验证AI AgentSurveyAgent 安全

本文梳理了 humanclaw.me/blog/papers/ 上同时涉及形式化验证与 AI Agent 的 15 篇论文,按 5 个研究方向分类,并提供全量对比总表与技术路线分析。

总体概览

形式化验证与 Agent 的结合是 2025-2026 年最活跃的研究方向之一。这 15 篇论文覆盖了两个互补的维度:

  • 「形式化方法 → Agent」(10 篇):用形式化方法保障 Agent 的安全与可靠性
  • 「Agent → 形式化方法」(3 篇):用 AI Agent 自动化/规模化形式化验证
  • 「双向融合」(2 篇):形式化规约引导多智能体学习

五大研究方向总览
五大研究方向总览


五大研究方向分类

方向 A:运行时安全约束与执行(Runtime Safety Enforcement)

核心理念:在 Agent 执行过程中插入形式化或半形式化的检查点,实时拦截不安全行为。

#论文年份技术路线核心机制拦截率开销
1ShieldAgent2025 (ICML)概率规则电路再造一个 Agent 用形式化规则电路盯着主 Agent
2Agent Behavioral Contracts2026设计契约 (DbC)四元组 (P, I, G, R):前置条件+不变量+治理+恢复,OU 过程漂移控制D* < 0.27< 10ms
3AgentSpec2026 (ICSE)DSL 运行时引擎trigger-check-enforce 三段式规则,拦截关键执行点> 90%毫秒级
4Agent-C2026SMT 求解器DSL 表达时序属性 → 一阶逻辑 → SMT 检查100% 合规,0% 伤害
5ActPlane2026eBPF 内核级策略 DSL 编译为 eBPF/BPF-LSM 钩子 + 信息流控制97.7%(语义反馈)1.9%

共同特征:都强调轻量级(毫秒级开销)、可定制(DSL/合约)、与模型无关(不修改 LLM 本身)。


方向 B:语义框架与安全属性形式化(Formal Semantic Frameworks)

核心理念:为 Agent 系统建立形式化的语义模型,用数学语言定义"什么是安全的"。

#论文年份技术路线核心贡献形式化工具
6Formalizing Agentic AI Safety2026双模型统一语义框架宿主智能体模型 + 任务生命周期模型,定义 30 个形式化属性CTL/LTL 时序逻辑
7Intent-to-Execution Integrity2026CompCert 风格语义保持Agent 安全 = intent-to-execution integrity,4 条完整性性质借鉴 CompCert
8Formalizing LLM Agent Security2026情境属性四维框架4 安全性质 + 5 Oracle 函数,重新形式化 9 类攻击形式化 Oracle 函数
9SENTINEL2025时态逻辑三级验证语义层→计划层→轨迹层,LTL/CTL 评估具身智能体LTL/CTL + VirtualHome/AI2-THOR

共同特征:偏理论,为工程实践奠定基础;都使用时序逻辑(LTL/CTL)作为形式化语言;揭示了现有防御的结构性盲点。


方向 C:Agent 驱动形式化验证(Agent-Driven Formal Verification)

核心理念:反过来,用 AI Agent 的能力去自动化传统形式化验证中繁琐的部分——写规约、做证明、发现 bug。

#论文年份验证方法核心创新规模/效果
10SPDDWL2026交互式定理证明 (Rocq/Coq)三阶段流水线:需求→编码计划→证明状态驱动修复1,859 行受验证代码,全测试通过
11FM-Agent2026Hoare 式自然语言推理自顶向下规格推导 + 分层并行 + 自动 Bug 验证277k LoC,发现 522 个新 bug
12ProofWright2026 (J. ACM)Agent 驱动 CUDA 验证用 AI Agent 为 LLM 生成的 GPU 内核代码做形式化验证CUDA 内核安全验证

共同特征:颠覆了"规格先行"的传统范式,让 LLM 从调用点反推规格;利用 Agent 的代码理解和推理能力,替代人工写证明/写规格。


方向 D:形式化方法引导多智能体学习(Formal Methods for MARL)

核心理念:用形式化规约语言(HyperLTL、DFA)作为奖励信号或约束条件,引导多智能体强化学习的策略学习。

#论文年份规约语言核心机制实验环境
13HyPOLE2026HyperLTL 超性质Skolemization 消除量词交替 + 鲁棒性函数量化满足度 + CTDE 算法SMAC, MessySMAC, WildFire
14ACC-MARL2026 (ICML)DFA 确定性有限自动机马尔可夫化重构 + 势函数奖励塑形 + 预训练 RAD Embeddings协作多智能体任务

共同特征:将形式化语言转化为可微分的训练信号;解决的是协作策略学习中对历史依赖和全局约束的表达难题。


方向 E:位置论文与愿景(Position Papers & Grand Challenges)

#论文年份核心论点
15Intent Formalization2026 (微软研究院)AI 代码生成时代,核心挑战是将模糊的人类意图转化为可检查的正式规约,提出从测试到 DSL 的四层谱系。

全量对比总表

#论文简称年份来源研究方向形式化方法应用层面关键指标
1ShieldAgent2025ICML运行时安全概率规则电路单 Agent 安全
2Agent Behavioral Contracts2026arXiv运行时安全Design by Contract + OU 过程单/多 AgentD*<0.27, <10ms
3AgentSpec2026ICSE运行时安全DSL + Runtime Enforcement代码/具身/自动驾驶>90% 拦截率
4Agent-C2026arXiv运行时安全DSL + SMT 求解器单 Agent 时序约束100% 合规率
5ActPlane2026arXiv运行时安全eBPF + 信息流控制OS 级 Agent 策略97.7% 合规, 1.9% 开销
6Formalizing Agentic AI Safety2026arXiv语义框架CTL/LTL + 状态机多 Agent 协议层30 个形式化属性
7Intent-to-Execution Integrity2026arXiv语义框架语义保持 (CompCert 风格)端到端 Agent 安全4 条完整性性质
8Formalizing LLM Agent Security2026arXiv语义框架Oracle 函数 + 情境属性9 类攻击形式化4 安全性质
9SENTINEL2025arXiv语义框架LTL/CTL 三级验证具身智能体VirtualHome + AI2-THOR
10SPDDWL2026arXivAgent 驱动验证交互式定理证明 (Rocq)代码生成正确性1,859 行受验证代码
11FM-Agent2026arXivAgent 驱动验证Hoare 式自然语言推理大规模代码验证277k LoC, 522 bugs
12ProofWright2026J. ACMAgent 驱动验证Agent 驱动 CUDA 验证GPU 内核安全
13HyPOLE2026arXiv形式化引导 MARLHyperLTL 超性质多智能体 RLSMAC 等基准
14ACC-MARL2026ICML形式化引导 MARLDFA 确定性有限自动机多智能体协作
15Intent Formalization2026arXiv愿景意图形式化四层谱系AI 代码生成微软研究院

关键洞察与趋势

1. 「反馈质量 > 验证能力」

SPDDWL 的 Rocq vs. Dafny 对比实验揭示:当验证后端由 LLM Agent 操作时,反馈信息的粒度和可操作性比验证引擎本身的能力更重要。Dafny 的 SMT 求解器超时只返回"未知",而 Rocq 返回的显式证明状态("当前子目标是什么")恰好是 LLM 最擅长消费的结构化反馈格式。

2. 漂移是本质属性,不是 bug

Agent Behavioral Contracts 将 LLM 的行为漂移建模为 Ornstein-Uhlenbeck 随机过程,承认了重要认知:行为漂移不是模型缺陷,而是 LLM 非确定性的必然结果。正确的目标不是消除漂移,而是将漂移控制在可接受边界内(D* = α/γ)。

3. 多 Agent 系统的可靠性退化是数学事实

Agent Behavioral Contracts 证明了复合定理:N 个 Agent 串联时,可靠性以乘积方式退化(~p^N)。10 个各自 95% 可靠的 Agent 串联,整体可靠性仅约 60%。这意味着多 Agent 系统的设计必须考虑链长度和中间检查点。

4. 从「提示词工程」到「行为规格工程」

多篇论文不约而同地指向同一个趋势:AI Agent 正在从"写提示词 + 运气"进化到"写形式化行为规格 + 运行时强制执行"。这与软件工程从"写代码"到"契约驱动开发"的进化路径高度相似。

5. 形式化验证正在因 Agent 而 Scale

传统形式化验证的最大瓶颈是"谁来写规格",而 FM-Agent 和 SPDDWL 证明了:当 LLM 生成代码时,规格和代码可以一起"涌现"——从调用点反推被调者的契约,而不是先有规格后有代码。这打破了数十年来"规格先行"的范式。

6. 运行时安全是当前最务实的路径

15 篇论文中,5 篇(33%)聚焦于运行时安全约束,而仅 4 篇(27%)是纯理论语义框架。社区共识倾向于 先落地再完备——在无法做到完全形式化验证之前,轻量级运行时检查是最可行的折中方案。


按技术路线的横向对比

形式化工具选择

形式化工具使用论文适用场景特点
CTL/LTL 时序逻辑#6, #9安全属性定义、状态机约束成熟,有 NuSMV/UPPAAL 工具支持
SMT 求解器#4一阶逻辑约束求解全自动,但超时问题显著
交互式定理证明 (Rocq/Coq)#10代码级正确性证明证明状态反馈质量高,适合 LLM 驱动
Hoare 逻辑#11程序验证传统方法,FM-Agent 将其泛化到自然语言
HyperLTL 超性质#13多智能体全局性质能表达"所有 Agent 都不..."类超性质
DFA 确定有限自动机#14协作任务规约直观,可嵌入为奖励信号
Design by Contract#2运行时行为约束工程性好,轻量
eBPF/BPF-LSM#5内核级策略执行OS 级可见性,83% 策略可观测
概率规则电路#1Agent 安全判定可解释,有形式化保证

验证层面

层面论文说明
OS 内核级#5 (ActPlane)最底层,eBPF 钩子拦截系统调用
协议/通信层#6MCP + A2A 协议统一语义
运行时执行层#1, #2, #3, #4在 Agent 每步执行前后插入检查
代码/语义层#10, #11, #12对生成的代码做形式化证明
策略学习层#13, #14形式化规约嵌入 RL 训练
概念/框架层#7, #8, #15定义问题和研究议程

总结

这 15 篇论文共同描绘了一幅清晰的图景:形式化验证与 AI Agent 正从两个独立领域走向深度融合

  • 短期(现在):运行时安全约束是最务实的切入点——轻量、可部署、模型无关。ABC、AgentSpec、Agent-C 已经给出了可落地的方案。
  • 中期(1-2 年):语义框架(四维安全属性、30 个形式化属性)将逐步从学术论文走向工程标准,成为 Agent 安全评估的基准。
  • 长期(2-5 年):FM-Agent 和 SPDDWL 所示的"Agent 驱动形式化验证"可能彻底改变软件验证的范式。

推荐阅读的三篇核心论文:

  1. Agent Behavioral Contracts — 工程可用性最强,已有开源库(AgentAssert)
  2. FM-Agent — 展示 Agent 驱动验证的规模化潜力(522 个 bug)
  3. Formalizing Agentic AI Safety — 为多 Agent 系统安全定义完整形式化框架

参考文献

  1. Zhaorun Chen, Mintong Kang, Bo Li. "ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning." ICML 2025, arXiv:2503.22738. 解读
  2. Varun Pratap Bhardwaj. "Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents." arXiv, 2026. 解读
  3. Haoyu Wang, Christopher M. Poskitt, Jun Sun. "AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents." ICSE 2026. 新加坡管理大学. 解读
  4. Adharsh Kamath et al. "Enforcing Temporal Constraints for LLM Agents." arXiv:2512.23738, 2026. 解读
  5. Yusheng Zheng et al. "ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses." arXiv:2606.25189, 2026. UC Santa Cruz. 解读
  6. Edoardo Allegrini, Ananth Shreekumar, Z. Berkay Celik. "Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems." arXiv:2510.14133, 2026. 解读
  7. Wenjie Qu et al. "Securing LLM Agents Need Intent-to-Execution Integrity." arXiv, 2026. NUS / UCLA / UC Berkeley. 解读
  8. Vincent Siu et al. "A Framework for Formalizing LLM Agent Security." arXiv, 2026. UC Santa Cruz / UC Berkeley / Duke. 解读
  9. Simon Sinong Zhan et al. "SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents." arXiv:2510.12985, 2025. 解读
  10. Jian Fang, Yingfei Xiong. "Trustworthy Software Project Generation: a Case Study with an Interactive Theorem Prover." arXiv:2605.26017, 2026. 北京大学. 解读
  11. Haoran Ding, Zhaoguo Wang, Haibo Chen. "FM-Agent: Scaling Formal Methods to Large Systems via LLM-Based Hoare-Style Reasoning." arXiv:2604.11556, 2026. 上海交通大学. 解读
  12. Bodhisatwa Chatterjee et al. "ProofWright: Towards Agentic Formal Verification of CUDA." J. ACM, 2026. Georgia Tech / NVIDIA / Stanford. 解读
  13. Arshia Rafieioskouei et al. "HyPOLE: Hyperproperty-Guided Multi-Agent Reinforcement Learning under Partial Observation." arXiv, 2026. MSU. 解读
  14. Beyazit Yalcinkaya et al. "Automata-Conditioned Cooperative Multi-Agent Reinforcement Learning." ICML 2026, PMLR 306. UC Berkeley. 解读
  15. Shuvendu K. Lahiri. "Intent Formalization: A Grand Challenge for Reliable Coding in the Age of AI Agents." arXiv, 2026. 微软研究院. 解读