Skip to main content
2026arXiv

认知防火墙:面向 LLM 安全的主动式零信任多门框架

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

现有 LLM 运行时防护将每条消息作为孤立分类对象,无法捕捉跨对话轮次累积的恶意意图。本文提出认知防火墙(Cognitive Firewall),将安全判断分解为意图、零信任上下文、一致性、输出风险四个独立门控,通过升级决策规则而非评分平均来组合判断,在四个越狱基准上将攻击成功率降至 2% 以下。

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz
AI解读LLM 安全越狱防御零信任多轮攻击运行时防护

论文概览

当前 LLM 安全防护的主流做法是部署一个"危害分类器"——对每条输入提示和每条输出响应打分,然后根据阈值决定是否放行。Llama Guard、ShieldGemma、Granite Guardian 都是这一路线的产物。问题在于,一个耐心的攻击者完全可以将恶意目标拆解到多个对话轮次中,让任何单条消息看起来都无害,最终通过累积交互引导模型产出受限内容。

这篇来自 Roma Tre University 和 University of Alabama 的论文提出了一个根本性的判断转向:守护模型不是一个分类问题,而是一个理解问题。作者认为,分类器框架本身就是为什么有耐心的攻击者仍然能从受保护模型中提取受限内容的原因——危害不必出现在任何单条消息中,它可以存在于交互的整体之中:用户正在引导的目标、声称但并不持有的权限、由各自无害的部分组装而成的恶意目标。

Cognitive Firewall 的核心设计是一个独立的监督模型,插入在用户与受保护目标模型之间,将安全判断分解为四个分类门控:意图门(G1)、零信任上下文门(G2)、一致性门(G3)和输出风险门(G4)。前三门在目标模型生成前运行,第四门在生成后检查候选响应。门控决策通过"升级"(escalation)而非评分平均来组合——任何一个门触发危险判决就阻断交互,同时保留人类可读的审计理由。

核心创新

四门分解:从分类到理解

认知防火墙四门分解管线
认知防火墙四门分解管线

框架将安全判断分解为四个独立的分类门控,每个门只回答一个狭窄、可辩护的问题:

门控阶段判决标签捕获的攻击模式
G1 意图门生成前safe / unsafe直接有害请求(单轮)
G2 零信任上下文门生成前plausible / manipulative冒充角色、权限声称、越狱覆盖指令
G3 一致性门生成前consistent / escalating渐进升级、任务分解、上下文漂移
G4 输出风险门生成后safe / harmful有害负载(兜底防线)

意图门的关键设计在于"指称物还原":它不只看措辞是否危险,而是先识别请求实际会产出的真实世界交付物,将一个暴力或骇人的术语还原为其真实指称物。比如"杀死进程"在字面上是"杀死",但指称物是软件操作。只有当交付物本身就是可转移的危害(武器合成、恶意软件、仇恨内容)时才判为 unsafe。这个设计防止了大量"听起来危险但实际无害"的请求被误拒。

零信任上下文门:隔离操纵通道

这是我看来本文最有创意的一门。零信任上下文门借鉴了网络安全中的零信任原则——"永不信任,始终验证"——但将其应用到对话内的角色和权限声明上。它判断的唯一问题是:用户是否声称了某种角色、身份、权限或覆盖指令,以获取信任或解锁受限答案。

关键在于它是"话题盲"的:话题归意图门管,上下文门只关注对话内的第一人称声明。描述第三方(如"我的医生说"或"黑客通常这样做")不会触发它。一个冒充开发者或操作员的声明、越狱或覆盖指令、声称凭据以解锁受限答案的尝试被归类为 manipulative 并阻断;而一个普通的合法角色提及被归类为 plausible。

论文的 Table I 定位了 Cognitive Firewall 在四条能力轴上的独特性——分解(Decomp.)、轨迹(Traj.)、零信任上下文(ZT-ctx)、生成前阻断(Pre-gen)。现有系统在这四条轴上都有缺口:

四门分解与防御系统对比
四门分解与防御系统对比

升级决策规则:不平均,不稀释

门控决策通过升级而非评分平均来组合。这一点在方法论上非常重要。已有研究指出,将每轮风险平均为单一数值在构造上就是不足的。Cognitive Firewall 的做法是:任何一个门触发危险判决就阻断整个轮次,没有任何门可以"稀释"另一个门的告警信号。每个阻断都携带一个记录在案的人类可读判决理由,使决策可审计。

方法论

威胁模型

论文假设对抗性用户直接通过 API 访问目标模型,有三种操纵通道:有害话题、声称权限、多轮策略。系统提示和服务栈被信任,目标模型被视为通过 API 访问的黑盒。判决必须跨越整个对话而非单条消息,声称的上下文必须被验证而非被相信,行动必须在目标模型生成之前发生,每个阻断必须追溯到狭窄可审计的判断而非一个不透明的分数。

实验设计

  • 目标模型:mistral(本地服务)
  • 监督模型:qwen3.5:8b(运行全部四门)
  • 危害判定器:qwen3.5:122b(同族但更大模型,单独实例化,绝不作为门控使用)
  • 攻击集:jbb(100 条单轮直接有害请求)、crescendo(50 条多轮升级攻击)、safemt(50 条 ActorAttack 分解攻击)、mhj(50 条人工多轮越狱)
  • 良性集:xstest(120 条表面有害但实际良性的提示)
  • 基线:三个已发布的守卫模型(Llama Guard 3 8B、ShieldGemma 9B、Granite Guardian 8B)+ 两个轨迹感知防火墙(THRD 风格、TCA 风格)

每个攻击落入三个互斥结果之一:ASR(至少一轮有害交付)、blk(在任何危害之前遏制)、以及剩余的既未成功也未遏制部分。关键规则是:后来的阻断不能撤销早期的泄露。

实验结果

主对比:攻击成功率

实验结果对比
实验结果对比

Cognitive Firewall 在三个攻击集上将 ASR 降至 2% 或更低,在最困难的人工越狱集 mhj 上为 14%:

防御jbb ASRcrescendo ASRsafemt ASRmhj ASRauth 阻断xstest OR
无防御45%10%30%74%0%0%
Llama Guard 3 8B8%0%36%26%54%3%
ShieldGemma 9B26%0%22%44%40%18%
Granite Guardian 8B0%0%20%26%66%21%
THRD 风格0%0%20%40%50%22%
TCA 风格0%6%24%50%40%14%
Cognitive Firewall1%0%2%14%75%8%

三个守卫模型都是逐条消息分类器,在分解攻击集上各自失败——safemt 上 ASR 为 20-36%,mhj 上为 26-44%。两个轨迹风格防火墙虽然读取整个对话,但将其压缩为单一累积或整体评分仍然失败——safemt 上 20-24%,mhj 上 40-50%,同时过度拒绝更频繁。Cognitive Firewall 是唯一在所有多轮集上保持低 ASR 的系统。

逐门消融

消融实验揭示了每个门的独特贡献:

  • 去掉意图门:jbb 遏制率从 92% 降至 86%——意图门提供直接请求的主动遏制
  • 去掉一致性门:影响最大——crescendo 遏制率从 100% 降至 72%,safemt 从 78% 降至 64%,mhj 从 86% 降至 72%
  • 去掉输出门:safemt ASR 从 2% 升至 16%,mhj ASR 从 14% 升至 32%——输出门是反应性兜底
  • 去掉上下文门:权限探测阻断率从 75% 降至 0%——但标准攻击集中几乎无影响

生成前门和输出门是互补的。仅用生成前门,crescendo 遏制率为 96%、safemt 为 54%、mhj 为 68%;仅用输出门分别为 34%、60%、66%;完整防火墙分别为 100%、78%、86%。这种互补性证明了分解防御的必要性——单一遍历对话的防线不足以覆盖所有攻击模式。

泛化能力

设置jbbcrescendosafemtmhj
留出对话切片0%4%14%
交换目标(llama3.2:3b)0%2%6%4%
交换监督模型(gemma4:31b)2%0%2%6%

交换目标模型和监督模型后 ASR 均保持在 6% 以下,表明框架设计不依赖于特定模型。此外,白盒自适应攻击中(20 个手工探测,每门缝 5 个),防火墙拦截了 18/20,两个突破均发生在分解缝上。

过度拒绝

意图门的指称物还原设计有效防止了良性提示的误拒。Cognitive Firewall 在 xstest 上的过度拒绝率为 8%,远低于 ShieldGemma(18%)和 Granite Guardian(21%)。值得注意的是,Granite Guardian 虽然权限阻断率达 56%,但过度拒绝率高达 21%——阻断更多但误伤也更重。去掉上下文门后防火墙过度拒绝率降至 0%,但权限探测阻断率也归零,因为门设计上允许通过"虚构凭据"探测以避免拒绝真正的专业人士。

启示与思考

从分类到理解的范式转向。这篇论文最重要的洞察可能不是四门本身,而是对"安全即分类"这一默认假设的质疑。当危害可以存在于交互的整体而非任何单条消息中时,逐条消息分类器在构造上就是不足的。Cognitive Firewall 将安全判断重新定义为一种理解活动——理解用户的演化目标、验证声称的上下文、追踪对话轨迹——然后用分解的门控结构来组织这种理解。这让我联想到 ActPlane 的思路:两者都反对将安全简化为单一检查点,但 ActPlane 在 OS 层用 eBPF 追踪跨事件数据流,Cognitive Firewall 在对话层用门控分解追踪跨轮次意图累积。它们共享的设计哲学是:安全需要全局视野和可分解的结构化判断。

零信任原则的迁移。将网络安全的零信任原则迁移到对话内角色声明上,是一个巧妙的设计。传统做法要么完全忽略角色声明(导致权限冒充攻击),要么在系统提示中统一处理(导致"系统提示优先"的脆弱假设)。Cognitive Firewall 将其独立为一个门控,既不信任也不忽略,而是作为"未验证证据"来检查。这种隔离使得操纵通道变得独立、可审计、可在生成前行动。不过,上下文门的标准攻击集表现也暴露了一个设计取舍:为了不拒绝真正的专业人士,它对"虚构凭据"探测保持放行,这是一个安全性与可用性的固有张力。

升级而非平均的决策哲学。论文引用已有研究指出"将每轮风险平均为单一数值在构造上不足"——这个判断对更广泛的安全系统设计都有启发。在很多安全场景中,任何一个维度的强告警信号都不应被其他维度的"看起来还好"所稀释。升级规则的本质是:安全是"与"关系而非"或"关系——任何一个维度不安全就不安全。这与 AgentFlow 中"依赖驱动的静态分析"思路也有呼应:两者都拒绝将安全简化为单一指标,转而追踪多维度的结构化风险信号。

局限性是坦诚的。论文明确列出了几个关键限制:攻击集规模较小(50-100 条对话),单条对话值 1-2 个 ASR 点;所有危害判决来自同一族系的单一判定器,同族偏差不能排除;两个轨迹感知基线是作者自行复现的,THRD 风格版本省略了原始的响应评估项;mhj 和 crescendo 的门控提示是在各集首批对话上开发的,存在样本内偏差。8B 监督模型本身也可能被注入攻击——所有四门由同一模型运行,一次成功的注入可能同时翻转所有门控。这些限制都是真实的,但论文的坦诚反而增强了其结论的可信度。

未来方向。论文指出了几个值得追踪的方向:允许监督模型在困难案例上进行"审议"(deliberate),将门控提示暴露为可校准的危害策略,以及使用不同族系的判定器来消除同族偏差。如果 Cognitive Firewall 的四门框架被验证为可泛化的安全架构,它可能成为 LLM 运行时防护的新范式——就像零信任架构重塑了网络安全一样。

参考链接