Token导航 LogoToken导航TokenDH.com

30B追平Qwen3-235B!中科大开源Agent驱动长上下文训练新范式,把多轮轨迹编译成高质量数据

更新时间 2026-06-03来源 智猩猩正文 1999字阅读约 7分钟8 张图片
中科大研究团队投稿

智猩猩AI整理

Agent赛道越火,长上下文能力越成为刚需。

当前主流做法要么靠人工精标长文档,成本高到离谱;要么靠启发式拼接短文本,长程依赖关系薄弱,训出来的模型"只见树木不见森林"。

中科大和上海创智学院的研究团队最新提出了一种低成本、可扩展的长上下文训练新范式——Agent Context Compilation(ACC),将Agent做对的多轮交互轨迹重新编译为高质量长上下文QA对。用这套数据微调Qwen3-30B-A3B后,MRCR暴涨18.1分、GraphWalks提升7.6分,直接追平参数量近8倍的Qwen3-235B-A22B,且通用能力基本保持。目前,论文、数据集和模型权重已全面开源。

图片
  • 论文标题:

    ACC: Compiling Agent Trajectories for Long-Context Training  

  • 论文链接:

    https://arxiv.org/abs/2605.21850  

  • 模型地址:

    https://huggingface.co/groundhogLLM/ACC-Qwen3-30B-A3B  

  • 数据集地址:

    https://huggingface.co/datasets/groundhogLLM/ACC-dataset

01

痛点:Agent SFT的"监督盲区"

Agent在解决复杂问题时,会经历多轮工具调用,证据散落在各轮次的工具响应里。但标准Agent SFT只监督每轮的工具选择和推理,把工具返回的观察内容(observation)全部mask掉。

论文从优化目标的角度揭示了这一问题的本质:前 k-1 轮只监督局部推理和工具选择,只有最后一轮才监督最终答案。这意味着中间轮次的工具响应token被完全排除在损失之外,相关梯度若要到达这些token,必须反向传播经过漫长的中间轮次链,信号被严重削弱。

论文将这一现象称为"监督盲区"(Supervision Blind Spot):模型学会了"下一步该调用什么工具",却从未被直接监督过"如何整合跨轮次的分散证据给出最终答案"。做对轨迹中蕴含的长程依赖信号,在训练中被白白过滤掉了。

02

方法:ACC三步编译

ACC的核心思想是将多轮做对轨迹映射为单轮长上下文样本,让最终答案的监督信号直接触及每一个证据token。

图片

三步编译流程:

1. 提取:从做对轨迹中提取工具返回或环境信息作为证据片段,聚合后的上下文本身天然足以回答问题;

2. 打乱:对证据片段随机打乱顺序并拼接,限制在token预算内,迫使模型通过语义关联而非顺序位置定位信息;

3. 合成:使用DeepSeek-V3.2-Thinking生成候选推理链,只保留能推导出正确答案的作为训练用的reasoning trace。

针对不同Agent类型,团队设计了差异化的证据提取和干扰项策略:

图片

Search和SWE的干扰项帮助模型学习在噪声中定位关键证据;SQL数据表本身具有强关系结构,天然适合训练图遍历式的长程推理。

图片

03

结果:30B媲美235B

团队在Qwen3-30B-A3B-Thinking上进行SFT,训练数据共10,802条做对轨迹,上下文长度覆盖2K~128K tokens。

长程依赖建模基准测试结果(Overall):

图片

在MRCR和GraphWalks这两个最考验跨轮次长程依赖的基准上,ACC微调后的30B模型表现媲美参数量近8倍的Qwen3-235B-A22B。

通用能力基本保持:

图片

UMAP可视化和线性分类器分析(AUC=0.9986)证实,训练数据与通用基准测试题不存在数据泄露,性能提升来自可迁移的长上下文推理能力。

图片

04

机制揭秘:注意力重组与专家特化

团队进一步做了机制分析,发现ACC训练后模型并非机械地"拉长注意力",而是展现出任务自适应的灵活结构:

- GraphWalks任务:注意力在近端和远端同时增强,对应图遍历中"本地邻居检查+远距离节点跳跃"的需求;远端token的激活分散在多个专家上,实现均衡处理。

- MRCR任务:注意力主要增强近端,用于精准扫描和验证候选片段;同时某单一专家在全部token组上高度激活,形成专门的"扫描-验证"专家。

这说明ACC赋予模型的不是僵化的长上下文技巧,而是针对不同长程推理任务动态调配资源的底层能力。

图片

05

结论与展望

ACC的价值在于挖掘做对轨迹的隐藏价值:Agent运行产生的大量做对轨迹无需额外人工标注,直接编译即可成为高质量长上下文SFT数据。它可与任何现有长上下文扩展方法(如RoPE插值、NSA稀疏注意力)或后训练RL流程无缝结合。

研究团队也指出,当前工作仅在三种Agent类型和Qwen3-30B-A3B上验证,未来需扩展到更多Agent类型和百万token级上下文。此外,轨迹中的隐私与版权风险需要严格过滤。

对于正在构建Agent或训练长上下文模型的团队而言,ACC提供了一条低成本、高扩展性的数据合成路径,值得立即跟进。

文章标签Qwen阿里云模型发布开源智能体学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多