ZipRL:让 Agent 自己学会何时压缩、压缩多少
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
美团与中科院软件所提出 ZipRL,通过多粒度压缩机制和 Hindsight Response Replay(HRR),让 LLM Agent 在多轮搜索任务中自主选择压缩粒度,并通过 RL 优化压缩策略。在五个 Agent 基准上平均超越 SOTA 27.9%(4B)和 34.7%(8B),256 轮压力测试下仍保持稳定。
论文概览
当 LLM Agent 执行多轮搜索任务时,检索到的文档和交互历史会迅速耗尽有限的上下文窗口。现有的上下文压缩方法面临两个核心挑战:一是压缩粒度被忽略——所有文档被同等对待,无论其与查询的相关性高低;二是长程任务中奖励稀疏——RL 训练时只有最终结果给出 0/1 奖励,中间压缩步骤得不到有效反馈。
ZipRL(Meituan & 中科院软件所)针对这两个挑战提出了系统性解决方案。论文的核心贡献有三:
- 多粒度压缩机制:Agent 根据文档与查询的相关性,从 5 个压缩级别(Ultra-coarse 到 Ultra-fine)中动态选择,实现非均匀信息缩减
- Hindsight Response Replay(HRR):借鉴 HER 的思想,用压缩质量分数作为动态参考点,将稀疏终局奖励重新分配为密集的 turn 级信号
- 理论保证:Theorem 4.1 证明了在固定平均资源预算下,相关性感知的非均匀分配严格优于均匀分配
在五个 Agent 基准测试上,ZipRL 分别以 Qwen3-4B 和 Qwen3-8B 为基座,平均 EM 超越最强基线 27.9% 和 34.7%,并在 256 轮外推压力测试中保持鲁棒。

核心创新
一、多粒度压缩:从均匀裁剪到自适应分配
ZipRL 的第一个关键洞察是:不同文档对任务的相关性不同,理应承受不同粒度的压缩。一篇与查询高度相关的文档需要精确保留细节(Ultra-fine, 3000-6000 chars),而完全偏离主题的文档只需保留核心结论(Ultra-coarse, 200-500 chars)。
具体而言,论文设计了 5 级压缩策略:
| 级别 | 相关性 | 字符数范围 | 适用场景 |
|---|---|---|---|
| Level 1 | <20% | 200-500 | 主题完全偏离 |
| Level 2 | 20%-40% | 500-1000 | 主题扩展至相关方向 |
| Level 3 | 40%-60% | 1000-2000 | 主题扩展/深化 |
| Level 4 | 60%-80% | 2000-3000 | 主题密切相关 |
| Level 5 | >80% | 3000-6000 | 几乎保留所有关键信息 |
这一设计的理论基础是 Theorem 4.1:设 为相关性随机变量, 为平均资源预算, 为效用函数(对 严格凹), 为非递减的相关性感知分配函数且 ,则:
直觉上,当边际效用随相关性递增时,将更多资源分配给更相关的文档会带来严格的效用增益。实验中,Level 3(Medium)被选择最多(54.33%),说明模型学会了"中等压缩满足大多数文档"的策略,同时对高相关文档保留更多细节。
二、压缩质量评分(Qcom):四维启发式度量
为了在 RL 训练中评估每轮压缩的质量,论文设计了多维度的 Qcom 指标:
Qratio(压缩比):检查压缩后的长度是否落在目标级别 的区间 内。短于下限线性惩罚(信息丢失),长于上限非线性惩罚(冗余)。
Qinfo(信息保留):基于关键词重叠度量。从查询和原文中提取关键词集合 和 ,计算查询特定关键词覆盖率和通用内容保留率的加权组合()。关键设计:分母使用 而非 ,避免惩罚不可检索的关键词。
Qsem(语义完整):检查句子终结符、句子结构、长度合理性,防止激进压缩导致语言碎片化。
Qlevel(级别一致):不同级别不仅要求长度不同,还要求结构密度不同。Level 1 应由几句精炼语句构成,Level 5 允许详尽叙述。用词数和句子数的期望区间来惩罚"长度达标但结构不匹配"的情况。
人类评估验证了 Qcom 的有效性:100 个样本上,复合 Qcom 在 Fidelity()和 Coherence()上均优于任何单一子分数。
三、Hindsight Response Replay:从稀疏到密集
这是论文最精巧的设计。在标准 GRPO 中,轨迹 的所有 turn 共享同一个优势值:
这意味着即使一条轨迹最终失败(),其中某些 turn 的压缩行为可能质量很高,但它们得不到正向强化。HRR 解决了这个问题。

HRR 的核心步骤:
- 计算轨迹 的平均压缩质量作为参考点:
- 对每个 turn ,计算其相对于轨迹平均的偏差:
- 重塑优势值:
当 turn 的压缩质量高于轨迹平均时,优势值增大(正向强化);低于平均时,优势值减小。关键在于:即使整条轨迹失败(),高质量压缩的 turn 仍可能获得正的调整项,从而被强化。
这与经典 HER 的哲学一致——从非最优经验中提取学习信号。但实现方式不同:HER 替换目标并重放转换,HRR 替换参考点并重塑优势。HRR 不需要 replay buffer,也不需要显式的目标条件策略。
一个有趣的副产品是隐式课程学习:随着训练推进,模型压缩质量整体提升, 逐步上升,训练目标自动调高,形成自然的学习曲线。
训练流程
ZipRL 的训练分两个阶段:
Cold Start SFT:从 ASearcher-LRM-35k 采样 3,000 条查询,用 GPT-4o 合成压缩轨迹,经正确性和格式过滤后保留 1,155 条高质量样本进行 SFT,赋予模型基本的压缩能力。
RL with HRR:在 GRPO 框架中集成 HRR 优势重塑。训练目标为:
其中 是带有 HRR 优势的 clipped surrogate。
实验结果
主实验:五基准全面领先
在 MusiQue、SQuAD、Frames、Bamboogle 和 BC-Plus 五个数据集上,ZipRL 在多个模型规模上全面超越基线:
| 模型 | MusiQue EM | SQuAD EM | Frames EM | Bamboogle EM | BC-Plus EM | 平均 EM |
|---|---|---|---|---|---|---|
| AgentFold-4B | 16.0 | 19.4 | 14.3 | 44.0 | 15.6 | 21.9 |
| ZipRL-4B | 31.4 | 23.0 | 14.6 | 47.2 | 24.0 | 28.0 |
| AgentFold-8B | 21.6 | 20.8 | 12.3 | 42.4 | 15.6 | 22.5 |
| ZipRL-8B | 36.8 | 25.8 | 18.1 | 49.8 | 20.8 | 30.3 |
值得注意的是,ZipRL-3B(Qwen2.5-3B)的平均 EM 达到 26.6%,甚至超过了 AgentFold-8B(22.5%),展现出极高的参数效率。

256 轮外推压力测试
在 MusiQue 上将交互轮数从 2 逐步增加到 256,ZipRL-8B 在 128 轮后仍保持 36.8% EM,而 Qwen3-235B-ReAct(235B 参数)在 256 轮时降至 17.5%。诊断分析表明瓶颈不在数据集天花板(Oracle 51.3% EM)或检索器饱和,而在于超长上下文下的注意力稀释。
消融实验
以 Qwen3-8B 为基座的消融研究结果:
- 去除 RL 阶段(仅 Cold Start SFT):平均 EM 从 30.3 降至 26.4,证明 RL 优化至关重要
- 去除 Qinfo:降幅最大(30.3 -> 26.9),信息保留是最关键的压缩质量维度
- 去除 Qsem:影响次之(30.3 -> 27.7),语义完整性不可忽视
- 去除中间级别 L2&L4:降至 28.9,5 级粒度的完整性有贡献但非极端关键
- 参数 敏感性:在 范围内稳定, 最优
Token 效率与行为分析
ZipRL 的平均 token 消耗显著低于基线:在 20 轮交互中,ZipRL 约 8K tokens,而 Qwen3-235B-ReAct 达到约 18K tokens,AgentFold 约 15K tokens。
行为统计揭示了一个涌现特性:ZipRL 会根据问题难度自适应调整搜索深度——在简单的 Bamboogle 上仅搜索 2.5 次,在困难的 Frames 上搜索 8.5 次(3.4 倍增长)。这种难度感知行为完全是从结果奖励的 RL 训练中涌现的,没有被显式编程。
训练稳定性
HRR 显著降低了训练方差:3 次独立训练运行中,HRR 的跨运行标准差为 –,而标准 GRPO 为 –。这证明 HRR 不仅密集化了奖励信号,还起到了方差缩减的作用。
对抗噪声鲁棒性
在检索文档池中注入 0%-75% 随机噪声时,ZipRL 表现稳定。但在 100% 对抗性检索(所有文档都是精心构造的干扰项)下,EM 大幅下降(85-99% 降幅),这暴露了 Qcom 不考虑文档可信度的局限性。
启示与思考
压缩粒度是被低估的维度
这篇论文让我意识到,上下文压缩的研究长期聚焦于"压不压"和"压多少",却忽略了"对不同内容压不同力度"这个更本质的问题。ZipRL 的多粒度机制本质上是在做信息预算的非均匀分配——把有限的 token 预算优先花在高价值内容上。Theorem 4.1 给出了严格的理论支撑:只要边际效用随相关性递增,非均匀分配就严格占优。
HRR 的设计哲学值得借鉴
Hindsight Experience Replay 的核心思想是"从失败中学习"——HER 通过替换目标让失败轨迹变得有意义,HRR 通过替换参考点让失败轨迹中的高质量步骤得到强化。这种思路在 LLM Agent RL 中有广阔的应用空间:任何涉及多步骤、稀疏终局奖励的场景(如工具调用、代码生成、规划),都可以考虑类似的 advantage reshaping 技术来密集化训练信号。
更重要的是,HRR 不依赖外部模型(如 PRM),计算成本几乎为零(Qcom 是纯启发式度量),这让它在工程上极具吸引力。
局限性清晰
论文坦诚了三个局限:(1) Qinfo 依赖英文停用词,多语言场景退化;(2) Qcom 不考虑文档可信度,对抗性检索下崩溃;(3) Cold Start 依赖单一 QA 语料,结构化或代码密集任务的泛化存疑。这些局限指向了未来工作的方向:多语言压缩质量评估、对抗鲁棒性、以及跨任务泛化。
与 SELFCOMPACT 的对比
近期 Johns Hopkins 和 Apple 的 SELFCOMPACT 工作也关注"何时压缩"的问题,但策略截然不同:SELFCOMPACT 用 rubric probe 判断压缩时机,ZipRL 用多粒度机制决定压缩力度。前者解决"何时压"的问题,后者解决"压多少"的问题。两者互补——理想的自适应压缩系统可能需要同时具备时机判断和粒度选择能力。
参考链接
- 论文: arXiv 2605.28069
- 代码: https://github.com/huzhexin/ZipRL
- 作者: Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo, Wei Lin, Guojun Yin (Meituan, Institute of Software CAS)