智猩猩AI整理
Agent赛道越火,长上下文能力越成为刚需。
当前主流做法要么靠人工精标长文档,成本高到离谱;要么靠启发式拼接短文本,长程依赖关系薄弱,训出来的模型"只见树木不见森林"。
中科大和上海创智学院的研究团队最新提出了一种低成本、可扩展的长上下文训练新范式——Agent Context Compilation(ACC),将Agent做对的多轮交互轨迹重新编译为高质量长上下文QA对。用这套数据微调Qwen3-30B-A3B后,MRCR暴涨18.1分、GraphWalks提升7.6分,直接追平参数量近8倍的Qwen3-235B-A22B,且通用能力基本保持。目前,论文、数据集和模型权重已全面开源。

论文标题:
ACC: Compiling Agent Trajectories for Long-Context Training
论文链接:
https://arxiv.org/abs/2605.21850
模型地址:
https://huggingface.co/groundhogLLM/ACC-Qwen3-30B-A3B
数据集地址:
https://huggingface.co/datasets/groundhogLLM/ACC-dataset
01
痛点:Agent SFT的"监督盲区"
Agent在解决复杂问题时,会经历多轮工具调用,证据散落在各轮次的工具响应里。但标准Agent SFT只监督每轮的工具选择和推理,把工具返回的观察内容(observation)全部mask掉。
论文从优化目标的角度揭示了这一问题的本质:前 k-1 轮只监督局部推理和工具选择,只有最后一轮才监督最终答案。这意味着中间轮次的工具响应token被完全排除在损失之外,相关梯度若要到达这些token,必须反向传播经过漫长的中间轮次链,信号被严重削弱。
论文将这一现象称为"监督盲区"(Supervision Blind Spot):模型学会了"下一步该调用什么工具",却从未被直接监督过"如何整合跨轮次的分散证据给出最终答案"。做对轨迹中蕴含的长程依赖信号,在训练中被白白过滤掉了。
02
方法:ACC三步编译
ACC的核心思想是将多轮做对轨迹映射为单轮长上下文样本,让最终答案的监督信号直接触及每一个证据token。

三步编译流程:
1. 提取:从做对轨迹中提取工具返回或环境信息作为证据片段,聚合后的上下文本身天然足以回答问题;
2. 打乱:对证据片段随机打乱顺序并拼接,限制在token预算内,迫使模型通过语义关联而非顺序位置定位信息;
3. 合成:使用DeepSeek-V3.2-Thinking生成候选推理链,只保留能推导出正确答案的作为训练用的reasoning trace。
针对不同Agent类型,团队设计了差异化的证据提取和干扰项策略:

Search和SWE的干扰项帮助模型学习在噪声中定位关键证据;SQL数据表本身具有强关系结构,天然适合训练图遍历式的长程推理。

03
结果:30B媲美235B
团队在Qwen3-30B-A3B-Thinking上进行SFT,训练数据共10,802条做对轨迹,上下文长度覆盖2K~128K tokens。
长程依赖建模基准测试结果(Overall):

在MRCR和GraphWalks这两个最考验跨轮次长程依赖的基准上,ACC微调后的30B模型表现媲美参数量近8倍的Qwen3-235B-A22B。
通用能力基本保持:

UMAP可视化和线性分类器分析(AUC=0.9986)证实,训练数据与通用基准测试题不存在数据泄露,性能提升来自可迁移的长上下文推理能力。

04
机制揭秘:注意力重组与专家特化
团队进一步做了机制分析,发现ACC训练后模型并非机械地"拉长注意力",而是展现出任务自适应的灵活结构:
- GraphWalks任务:注意力在近端和远端同时增强,对应图遍历中"本地邻居检查+远距离节点跳跃"的需求;远端token的激活分散在多个专家上,实现均衡处理。
- MRCR任务:注意力主要增强近端,用于精准扫描和验证候选片段;同时某单一专家在全部token组上高度激活,形成专门的"扫描-验证"专家。
这说明ACC赋予模型的不是僵化的长上下文技巧,而是针对不同长程推理任务动态调配资源的底层能力。

05
结论与展望
ACC的价值在于挖掘做对轨迹的隐藏价值:Agent运行产生的大量做对轨迹无需额外人工标注,直接编译即可成为高质量长上下文SFT数据。它可与任何现有长上下文扩展方法(如RoPE插值、NSA稀疏注意力)或后训练RL流程无缝结合。
研究团队也指出,当前工作仅在三种Agent类型和Qwen3-30B-A3B上验证,未来需扩展到更多Agent类型和百万token级上下文。此外,轨迹中的隐私与版权风险需要严格过滤。
对于正在构建Agent或训练长上下文模型的团队而言,ACC提供了一条低成本、高扩展性的数据合成路径,值得立即跟进。







