Skip to main content
2026arXiv

ZipRL:让 Agent 自己学会何时压缩、压缩多少

ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

美团与中科院软件所提出 ZipRL,通过多粒度压缩机制和 Hindsight Response Replay(HRR),让 LLM Agent 在多轮搜索任务中自主选择压缩粒度,并通过 RL 优化压缩策略。在五个 Agent 基准上平均超越 SOTA 27.9%(4B)和 34.7%(8B),256 轮压力测试下仍保持稳定。

Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo, Wei Lin, Guojun Yin
AI解读Context CompressionRLVRAgentMulti-Turn Search

论文概览

当 LLM Agent 执行多轮搜索任务时,检索到的文档和交互历史会迅速耗尽有限的上下文窗口。现有的上下文压缩方法面临两个核心挑战:一是压缩粒度被忽略——所有文档被同等对待,无论其与查询的相关性高低;二是长程任务中奖励稀疏——RL 训练时只有最终结果给出 0/1 奖励,中间压缩步骤得不到有效反馈。

ZipRL(Meituan & 中科院软件所)针对这两个挑战提出了系统性解决方案。论文的核心贡献有三:

  1. 多粒度压缩机制:Agent 根据文档与查询的相关性,从 5 个压缩级别(Ultra-coarse 到 Ultra-fine)中动态选择,实现非均匀信息缩减
  2. Hindsight Response Replay(HRR):借鉴 HER 的思想,用压缩质量分数作为动态参考点,将稀疏终局奖励重新分配为密集的 turn 级信号
  3. 理论保证:Theorem 4.1 证明了在固定平均资源预算下,相关性感知的非均匀分配严格优于均匀分配

在五个 Agent 基准测试上,ZipRL 分别以 Qwen3-4B 和 Qwen3-8B 为基座,平均 EM 超越最强基线 27.9% 和 34.7%,并在 256 轮外推压力测试中保持鲁棒。

ZipRL 框架总览
ZipRL 框架总览

核心创新

一、多粒度压缩:从均匀裁剪到自适应分配

ZipRL 的第一个关键洞察是:不同文档对任务的相关性不同,理应承受不同粒度的压缩。一篇与查询高度相关的文档需要精确保留细节(Ultra-fine, 3000-6000 chars),而完全偏离主题的文档只需保留核心结论(Ultra-coarse, 200-500 chars)。

具体而言,论文设计了 5 级压缩策略:

级别相关性字符数范围适用场景
Level 1<20%200-500主题完全偏离
Level 220%-40%500-1000主题扩展至相关方向
Level 340%-60%1000-2000主题扩展/深化
Level 460%-80%2000-3000主题密切相关
Level 5>80%3000-6000几乎保留所有关键信息

这一设计的理论基础是 Theorem 4.1:设 RR 为相关性随机变量,αˉ\bar{\alpha} 为平均资源预算,Φ(r,α)\Phi(r, \alpha) 为效用函数(对 α\alpha 严格凹),f(r)f(r) 为非递减的相关性感知分配函数且 E[f(R)]=αˉ\mathbb{E}[f(R)] = \bar{\alpha},则:

E[Φ(R,f(R))]>E[Φ(R,αˉ)]\mathbb{E}[\Phi(R, f(R))] > \mathbb{E}[\Phi(R, \bar{\alpha})]

直觉上,当边际效用随相关性递增时,将更多资源分配给更相关的文档会带来严格的效用增益。实验中,Level 3(Medium)被选择最多(54.33%),说明模型学会了"中等压缩满足大多数文档"的策略,同时对高相关文档保留更多细节。

二、压缩质量评分(Qcom):四维启发式度量

为了在 RL 训练中评估每轮压缩的质量,论文设计了多维度的 Qcom 指标:

Qratio(压缩比):检查压缩后的长度是否落在目标级别 gg 的区间 [Llg,Lhg][L_l^g, L_h^g] 内。短于下限线性惩罚(信息丢失),长于上限非线性惩罚(冗余)。

Qinfo(信息保留):基于关键词重叠度量。从查询和原文中提取关键词集合 KqK_qKxK_x,计算查询特定关键词覆盖率和通用内容保留率的加权组合(λ1=0.7,λ2=0.3\lambda_1 = 0.7, \lambda_2 = 0.3)。关键设计:分母使用 Kqx|K_q \cap x| 而非 Kq|K_q|,避免惩罚不可检索的关键词。

Qsem(语义完整):检查句子终结符、句子结构、长度合理性,防止激进压缩导致语言碎片化。

Qlevel(级别一致):不同级别不仅要求长度不同,还要求结构密度不同。Level 1 应由几句精炼语句构成,Level 5 允许详尽叙述。用词数和句子数的期望区间来惩罚"长度达标但结构不匹配"的情况。

人类评估验证了 Qcom 的有效性:100 个样本上,复合 Qcom 在 Fidelity(ρ=0.68\rho = 0.68)和 Coherence(ρ=0.69\rho = 0.69)上均优于任何单一子分数。

三、Hindsight Response Replay:从稀疏到密集

这是论文最精巧的设计。在标准 GRPO 中,轨迹 ii 的所有 turn 共享同一个优势值:

AGRPO(i)=Rfinal(i)μgroupσgroupA_{\text{GRPO}}^{(i)} = \frac{R_{\text{final}}^{(i)} - \mu_{\text{group}}}{\sigma_{\text{group}}}

这意味着即使一条轨迹最终失败(Rfinal=0R_{\text{final}} = 0),其中某些 turn 的压缩行为可能质量很高,但它们得不到正向强化。HRR 解决了这个问题。

HRR 机制详解
HRR 机制详解

HRR 的核心步骤:

  1. 计算轨迹 ii 的平均压缩质量作为参考点:Qˉcom(i)=1Tj=1TQcom(i,j)\bar{Q}_{\text{com}}^{(i)} = \frac{1}{T} \sum_{j=1}^{T} Q_{\text{com}}^{(i,j)}
  2. 对每个 turn jj,计算其相对于轨迹平均的偏差:ΔQcom(i,j)=Qcom(i,j)Qˉcom(i)\Delta Q_{\text{com}}^{(i,j)} = Q_{\text{com}}^{(i,j)} - \bar{Q}_{\text{com}}^{(i)}
  3. 重塑优势值:A(i,j)=AGRPO(i)+wΔQcom(i,j)A^{(i,j)} = A_{\text{GRPO}}^{(i)} + w \cdot \Delta Q_{\text{com}}^{(i,j)}

当 turn jj 的压缩质量高于轨迹平均时,优势值增大(正向强化);低于平均时,优势值减小。关键在于:即使整条轨迹失败(AGRPO<0A_{\text{GRPO}} < 0),高质量压缩的 turn 仍可能获得正的调整项,从而被强化。

这与经典 HER 的哲学一致——从非最优经验中提取学习信号。但实现方式不同:HER 替换目标并重放转换,HRR 替换参考点并重塑优势。HRR 不需要 replay buffer,也不需要显式的目标条件策略。

一个有趣的副产品是隐式课程学习:随着训练推进,模型压缩质量整体提升,Qˉcom\bar{Q}_{\text{com}} 逐步上升,训练目标自动调高,形成自然的学习曲线。

训练流程

ZipRL 的训练分两个阶段:

Cold Start SFT:从 ASearcher-LRM-35k 采样 3,000 条查询,用 GPT-4o 合成压缩轨迹,经正确性和格式过滤后保留 1,155 条高质量样本进行 SFT,赋予模型基本的压缩能力。

RL with HRR:在 GRPO 框架中集成 HRR 优势重塑。训练目标为:

JZipRL(θ)=Eq,{oi}[1Gi=1G1oij=1oit=1oi,j(mt(i,j)βDKL[πθπref])]J_{\text{ZipRL}}(\theta) = \mathbb{E}_{q, \{o_i\}} \left[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{j=1}^{|o_i|} \sum_{t=1}^{|o_{i,j}|} \left( m_t^{(i,j)} - \beta D_{KL}[\pi_\theta \| \pi_{\text{ref}}] \right) \right]

其中 mt(i,j)m_t^{(i,j)} 是带有 HRR 优势的 clipped surrogate。

实验结果

主实验:五基准全面领先

在 MusiQue、SQuAD、Frames、Bamboogle 和 BC-Plus 五个数据集上,ZipRL 在多个模型规模上全面超越基线:

模型MusiQue EMSQuAD EMFrames EMBamboogle EMBC-Plus EM平均 EM
AgentFold-4B16.019.414.344.015.621.9
ZipRL-4B31.423.014.647.224.028.0
AgentFold-8B21.620.812.342.415.622.5
ZipRL-8B36.825.818.149.820.830.3

值得注意的是,ZipRL-3B(Qwen2.5-3B)的平均 EM 达到 26.6%,甚至超过了 AgentFold-8B(22.5%),展现出极高的参数效率。

实验结果对比
实验结果对比

256 轮外推压力测试

在 MusiQue 上将交互轮数从 2 逐步增加到 256,ZipRL-8B 在 128 轮后仍保持 36.8% EM,而 Qwen3-235B-ReAct(235B 参数)在 256 轮时降至 17.5%。诊断分析表明瓶颈不在数据集天花板(Oracle 51.3% EM)或检索器饱和,而在于超长上下文下的注意力稀释。

消融实验

以 Qwen3-8B 为基座的消融研究结果:

  • 去除 RL 阶段(仅 Cold Start SFT):平均 EM 从 30.3 降至 26.4,证明 RL 优化至关重要
  • 去除 Qinfo:降幅最大(30.3 -> 26.9),信息保留是最关键的压缩质量维度
  • 去除 Qsem:影响次之(30.3 -> 27.7),语义完整性不可忽视
  • 去除中间级别 L2&L4:降至 28.9,5 级粒度的完整性有贡献但非极端关键
  • 参数 ww 敏感性:在 w[0.25,0.8]w \in [0.25, 0.8] 范围内稳定,w=0.5w = 0.5 最优

Token 效率与行为分析

ZipRL 的平均 token 消耗显著低于基线:在 20 轮交互中,ZipRL 约 8K tokens,而 Qwen3-235B-ReAct 达到约 18K tokens,AgentFold 约 15K tokens。

行为统计揭示了一个涌现特性:ZipRL 会根据问题难度自适应调整搜索深度——在简单的 Bamboogle 上仅搜索 2.5 次,在困难的 Frames 上搜索 8.5 次(3.4 倍增长)。这种难度感知行为完全是从结果奖励的 RL 训练中涌现的,没有被显式编程。

训练稳定性

HRR 显著降低了训练方差:3 次独立训练运行中,HRR 的跨运行标准差为 σ=0.0099\sigma = 0.00990.01240.0124,而标准 GRPO 为 σ=0.0351\sigma = 0.03510.06380.0638。这证明 HRR 不仅密集化了奖励信号,还起到了方差缩减的作用。

对抗噪声鲁棒性

在检索文档池中注入 0%-75% 随机噪声时,ZipRL 表现稳定。但在 100% 对抗性检索(所有文档都是精心构造的干扰项)下,EM 大幅下降(85-99% 降幅),这暴露了 Qcom 不考虑文档可信度的局限性。

启示与思考

压缩粒度是被低估的维度

这篇论文让我意识到,上下文压缩的研究长期聚焦于"压不压"和"压多少",却忽略了"对不同内容压不同力度"这个更本质的问题。ZipRL 的多粒度机制本质上是在做信息预算的非均匀分配——把有限的 token 预算优先花在高价值内容上。Theorem 4.1 给出了严格的理论支撑:只要边际效用随相关性递增,非均匀分配就严格占优。

HRR 的设计哲学值得借鉴

Hindsight Experience Replay 的核心思想是"从失败中学习"——HER 通过替换目标让失败轨迹变得有意义,HRR 通过替换参考点让失败轨迹中的高质量步骤得到强化。这种思路在 LLM Agent RL 中有广阔的应用空间:任何涉及多步骤、稀疏终局奖励的场景(如工具调用、代码生成、规划),都可以考虑类似的 advantage reshaping 技术来密集化训练信号。

更重要的是,HRR 不依赖外部模型(如 PRM),计算成本几乎为零(Qcom 是纯启发式度量),这让它在工程上极具吸引力。

局限性清晰

论文坦诚了三个局限:(1) Qinfo 依赖英文停用词,多语言场景退化;(2) Qcom 不考虑文档可信度,对抗性检索下崩溃;(3) Cold Start 依赖单一 QA 语料,结构化或代码密集任务的泛化存疑。这些局限指向了未来工作的方向:多语言压缩质量评估、对抗鲁棒性、以及跨任务泛化。

与 SELFCOMPACT 的对比

近期 Johns Hopkins 和 Apple 的 SELFCOMPACT 工作也关注"何时压缩"的问题,但策略截然不同:SELFCOMPACT 用 rubric probe 判断压缩时机,ZipRL 用多粒度机制决定压缩力度。前者解决"何时压"的问题,后者解决"压多少"的问题。两者互补——理想的自适应压缩系统可能需要同时具备时机判断和粒度选择能力。

参考链接