Skip to main content
2026ICML 2026 (PMLR 306)

三思而后行:Thought-Aligner 与 Agent 行为安全思维矫正

Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction

复旦大学团队在 ICML 2026 发表 Thought-Aligner,提出一种面向 LLM Agent 的轻量级即插即用安全模块,在 Agent 执行危险操作前因果性地修正其不安全思维,将安全率从约 50% 提升至约 90%,超过现有护栏方法约 23 个百分点,同时保持任务有用性。模型仅需 1.5B 参数,单步延迟低于 100ms。

Changyue Jiang, Wenqi Zhang, Xudong Pan, Geng Hong, Min Yang
AI解读Agent 安全

论文概览

论文Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction

作者:Changyue Jiang, Wenqi Zhang, Xudong Pan, Geng Hong, Min Yang(复旦大学)

收录:ICML 2026 (Proceedings of the 43rd International Conference on Machine Learning, PMLR 306)

代码与模型Thought-Aligner-7B @ HuggingFace


核心贡献

问题定义

LLM Agent 在执行多步任务时,每次"思考-行动-观察"循环中的中间思维(intermediate thought)直接决定后续行为。即使是在良性指令下,思维的微小偏差也可能逐步累积,最终导向危险的工具调用——例如误删文件、泄露隐私或泄露财务信息。然而,现有的安全防护(如 GuardAgent、ShieldAgent、Athena)大多工作在输出过滤或外部规则层面,要么无法有效拦截"非恶意但危险"的行为,要么以终止任务执行为代价换取安全。

Thought-Aligner 的核心理念是:不要等到 Agent 做出危险动作再拦截,而是在思维层面就纠正它。

三个关键挑战

  1. 长程推理中的渐进式不安全:危险决策常常不是一步产生的,而是多步思维逐步偏离安全方向的结果。
  2. 高质量安全对齐数据稀缺:需要大量覆盖不同场景、不同 Agent 模型的安全/不安全思维配对数据。
  3. 轻量化部署需求:安全模块不应显著增加推理延迟或计算开销。

方法论

形式化框架

Agent 的行为轨迹定义为 MDP:

τ={I,(T0,A0,O0),(T1,A1,O1),,(Tn,An,On)}\tau = \{I, (T_0, A_0, O_0), (T_1, A_1, O_1), \ldots, (T_n, A_n, O_n)\}

其中 II 是用户指令,TiT_i 是第 ii 步的思维,AiA_i 是对应的动作,OiO_i 是环境反馈。

Thought-Aligner πϕ\pi_\phi 是一个独立的轻量级模型,在每步执行前进行因果干预:

Tisafe=πϕ(I,hi1,Ti)T_i^{\text{safe}} = \pi_\phi(I, h_{i-1}, T_i)

其中 hi1=(T0,O0,,Ti1,Oi1)h_{i-1} = (T_0, O_0, \ldots, T_{i-1}, O_{i-1}) 是历史轨迹。矫正后的思维 TisafeT_i^{\text{safe}} 被送回 Agent 的基座 LLM πθ\pi_\theta,由它重新生成安全的动作 AiA_i'

Thought-Aligner Architecture
Thought-Aligner Architecture

为什么选在思维层面干预? 相比直接微调基座模型的方法(昂贵且可能损害通用能力),Thought-Aligner 只在思维层面做最小化编辑——保留任务连贯性的同时,仅修正不安全推理步骤。这一设计使它与基座模型完全解耦,可以即插即用到任何支持显式思维输出的 Agent 框架中。

数据集构建

团队构建了覆盖 10 类风险场景(隐私风险、金融风险、网络安全风险等)的高质量偏好数据集,包含超过 74,000 对安全/不安全思维。构建流程如下:

  1. 指令生成:使用 DeepSeek-R1、Qwen3-235B-A22B、GPT-4.1、Claude-Sonnet-4 四个模型生成超过 20,000 条任务指令。
  2. 轨迹生成:以 ReAct 范式运行 Agent,在每步生成原始思维 TiT_i 和对应动作。
  3. 思维级标注:让 LLM 对每个思维进行安全性评估(safe / unsafe),对不安全思维生成最小修正版。
  4. 人工审核:两阶段过滤——先用启发式规则和 LLM 信号标记潜在风险,再由人工标注者确认最早的不安全思维并提供最小编辑的安全对应版本。

最终获得 33,000+ I-T-T(安全思维保值)对41,000+ I-T-C(不安全→安全修正)对

两阶段训练

Thought-Aligner 基于 Qwen2.5-1.5B/7B-Instruct 进行两阶段 SFT:

ϕ=argminϕEτD[logπϕ(TisafeI,hi1,Ti)]\phi^* = \arg\min_{\phi} -\mathbb{E}_{\tau \sim \mathcal{D}} \left[ \log \pi_\phi(T_i^{\text{safe}} \mid I, h_{i-1}, T_i) \right]

阶段训练数据目标
Stage 1: Warm-upI-T-T 对(安全思维→自身)稳定安全推理模式,防止过度矫正
Stage 2: Core Fine-tuningI-T-C 对(不安全→最小修正)学习精确的因果干预能力

这一设计精妙之处在于:Stage 1 让模型先学会"什么是不需要改的",避免对所有思维都进行"过度矫正"导致任务中断;Stage 2 再学习"需要改的时候怎么改",且强调最小修正原则——即只改变不安全的部分,不引入不必要的变化。

运行时部署

Thought-Aligner 以插件形式插入 Agent 的 think-act-observe 循环(见伪代码):

python
for i in range(max_iteration): T_i, A_i = Agent(trajectory) I, h_i_minus_1 = Extract(trajectory) T_i_safe = Thought-Aligner(I, h_i_minus_1, T_i) A_i_prime = Agent(trajectory + T_i_safe) O_i = ToolExecution(A_i_prime) trajectory = trajectory + (T_i_safe, A_i_prime, O_i)

实验结果

主实验:ToolEmu + Agent-SafetyBench(6 个 LLM × 7 种防护)

下表展示了 Thought-Aligner 在 ToolEmu 和 Agent-SafetyBench 上的核心结果:

Base LLMBest Baseline SafetyTA-1.5B SafetyTA-7B SafetyΔ over Best Baseline
GPT-4.184.7% (GuardAgent)93.1%95.2%+10.5%
o396.2% (GuardAgent)97.2%97.9%+1.7%
Claude-Sonnet-484.7% (GuardAgent)91.7%95.1%+10.4%
Qwen3-235B-A22B70.8% (GuardAgent)93.8%95.1%+24.3%
DeepSeek-V380.6% (GuardAgent)91.5%92.2%+11.6%
Llama-3.3-70B73.6% (Self-Refl.)92.7%93.1%+19.5%

Safety Rate Comparison
Safety Rate Comparison

关键发现

  1. 跨模型一致性:无论底层的 Agent 是 GPT-4.1 还是 Llama-3.3-70B,Thought-Aligner 均将安全率提升至 ~90% 以上,平均超越最强基线约 23 个百分点。
  2. 安全与有用性双赢:与终止式护栏(如 GuardAgent 检测到风险即中断任务)不同,Thought-Aligner 通过修正思维而非阻止执行来提升安全,有用性平均提升约 5%。
  3. 安全分数分布迁移:集成 Thought-Aligner 后,安全分数为 3(确定无风险)的轨迹占比达到约 80%。

消融实验

方法Safety RateHelpfulness Rate
Self-Reflection (训练无关)41.7%19.4%
Single-SFT (混训 I-T-T + I-T-C)85.4%35.4%
Thought-Aligner (两阶段 SFT)97.2%42.4%

两阶段训练相比单阶段 SFT 提升安全率约 10 个百分点,验证了"先稳定安全模式、再学最小修正"策略的有效性。

与原始大模型作 Aligner 的对比

直接用 DeepSeek-R1、GPT-4.1 等大模型做零样本思维矫正:最高安全率仅 72.9%(Claude-Sonnet-4),延迟 2.71 秒。而 Thought-Aligner-1.5B 的安全率为 92.7%,延迟仅 0.06 秒——参数不到 DeepSeek-R1 的 0.2%,延迟约为其 1%。

思维级分类精度

在 1,000 样本验证集上评估检测不安全思维的能力:

模型PrecisionRecallF1
Qwen2.5-1.5B-Instruct66.7%72.4%68.5%
Thought-Aligner-1.5B95.1%94.7%95.1%
Qwen2.5-7B-Instruct68.7%70.0%68.7%
Thought-Aligner-7B96.3%95.7%96.3%

高精度(96.3%)意味着误报率极低——Thought-Aligner 不会过度矫正安全的思维。

跨基准泛化验证

在 AgentHarm、AgentDojo、InjecAgent 三个额外基准上,Thought-Aligner 分别提升安全率约 15%、12%、19%,所有基准安全率均超 90%。


启示与思考

Thought-Aligner 给我最大的启发在于它选择了一个非常精妙的切入粒度。

传统的 Agent 安全方法大致分两类:一类是"事后审查"(输出过滤、终止执行),另一类是"事先塑形"(RLHF、模型微调)。前者过于粗暴——rm -rf 都已经执行了才喊停有什么用?后者虽然治本但代价太高——微调一个 235B 的模型可不是随手就能做的事。

Thought-Aligner 在两者之间找到了第三条路:在思维层面做最小因果干预。它不修改基座模型,不依赖规则库,不终止任务执行。它只是安静地站在 Agent 的"think"之后、"act"之前,如果发现思维有安全隐患就轻轻改一下措辞,然后让 Agent 自己重新生成安全的动作。

这一设计有几个值得玩味的性质:

  1. 因果性而非相关性:它干预的是动作的前因变量(思维),而不是与动作相关的下游变量(输出)。这使得纠正效果在 MDP 框架下是因果关系而非统计关联。
  2. 最小编辑原则:两阶段训练确保了"不做不必要的修改"。这对于实际部署至关重要——如果安全模块动辄把所有思维改得面目全非,Agent 很快就会丧失任务执行能力。
  3. 与 Agent 架构的天然正交:只要 Agent 有显式的思维输出(ReAct 是目前最主流的范式),Thought-Aligner 就可以即插即用。这种解耦设计意味着安全模块可以独立于 Agent 能力迭代。

当然也有局限性值得关注。论文覆盖的风险场景是 10 类——虽已很广,但真实世界的 Agent 安全威胁空间远不止于此。另外,Thought-Aligner 本身可以被攻击(adversarial safety module),这可能是未来的研究方向。最根本地,思维矫正的有效性依赖于基座模型具备"根据被矫正的思维重新生成安全动作"的能力——如果基座模型本身就极度不安全,思维矫正的效果会打折扣。

从产业角度看,1.5B 参数 + 60ms 延迟的组合意味着 Thought-Aligner 可以在边缘设备上运行。这对具身智能(embodied agent)和移动端 Agent 应用场景具有直接部署价值。复旦大学团队已将模型开源在 HuggingFace,这进一步降低了社区采纳的门槛。


参考文献

  1. Ruan et al., "ToolEmu: Identifying and Mitigating Safety Risks of LLM Agents via Tool Emulation," NeurIPS 2024.
  2. Zhang et al., "Agent-SafetyBench: Evaluating the Safety of LLM Agents," 2024.
  3. Andriushchenko et al., "AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents," ICLR 2025.
  4. Debenedetti et al., "AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents," NeurIPS 2024.
  5. Xiang et al., "GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning," 2025.
  6. Sadhu et al., "Athena: A Framework for Defending Machine Learning Systems Against Adversarial Patches," 2024.