Token导航 LogoToken导航

ACL 2026收录!中科大团队针对Agent工具调用场景提出PTE指标,统一内部推理与外部工具调用成本

更新时间 2026-06-16来源 智猩猩正文 3585字阅读约 12分钟8 张图片
中科大研究团队投稿

智猩猩AI整理

工具集成推理(Tool-Integrated Reasoning, TIR)已成为大模型Agent解决复杂任务的主流范式。然而,当前TIR的评估长期以准确率为主导,效率评估则停留在工具调用次数或生成token数等粗粒度指标层面。

这类指标难以反映TIR过程中的两个关键硬件开销:

一是KV-Cache失效。工具调用会中断LLM的连续解码,导致已缓存的键值对被驱逐,工具返回后模型需重新执行prefill计算;

二是上下文长度膨胀。工具返回的长文本(如网页摘要、执行日志)被完整追加到历史上下文后,后续每个解码步骤都需加载更大的KV-Cache。由于解码阶段通常为内存受限操作,上下文长度与解码延迟呈近似线性关系。

因此,token数高的轨迹未必延迟高,token数低的轨迹未必延迟低。现有指标无法准确刻画这种非线性成本特征。

中国科学技术大学团队针对上述评估盲区提出了PTE(Prefill Token Equivalents)指标。该指标从硬件执行特性出发,将内部推理与外部工具调用的成本统一到同一物理单位,并基于该指标识别出四种典型的低效推理模式。实验结果表明,准确率与推理成本并非正相关,错误推理路径的硬件成本往往高于正确路径。该成果已收录至ACL 2026。

图片
  • 论文标题:

    Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

  • 论文:

    https://arxiv.org/abs/2604.05404

  • 代码:

    https://github.com/sqs-ustc/tool-reasoning-framework-PTE

01

PTE:将异构开销统一为

Prefill Token等价物

PTE的核心思想是将TIR轨迹中的计算开销与内存开销,统一折算为等价的prefill token处理量。

(1) 形式化定义

对于包含k轮交互的TIR轨迹,PTE定义为:

图片

其中:

   :第i轮的prefill token数量,反映计算开销;

   :第i轮模型生成的token数量;

 :第 i 轮解码开始前的累积上下文长度,决定KV-Cache规模;

γ :解码操作相对于prefill操作的相对开销系数。

γ 并非经验性超参数,而是由模型架构(层数、隐藏维度、注意力机制设计如GQA/MLA)与部署硬件的运算强度(Hardware Operational Intensity, HOI)共同决定的物理量。

论文给出了该系数在H100、H200、A100、V100、RTX 4090等多种硬件上的推导值,验证了PTE的硬件可迁移性。

(2)与真实延迟的相关性验证

作者在工业级高并发环境(8×H200,256并发请求)中进行了墙钟时间(wall-clock latency)验证。结果显示:

简单token计数与真实延迟的皮尔逊相关系数仅为 r=−0.375 ,几乎无相关性;

PTE与真实延迟的皮尔逊相关系数达 r=0.9253 ,呈显著线性正相关。

这表明,决定推理速度的关键因素是上下文长度与解码阶段的耦合关系,而非单纯的token数量。

图片

(3)跨硬件鲁棒性

进一步地,PTE在不同硬件平台上保持了模型效率排序的一致性。在H100、H200、A100、V100、RTX 4090上分别计算γ 并重新评估模型,Spearman秩相关系数 ρ>0.95 。这说明PTE捕捉的是模型内在的推理效率特性,而非特定硬件平台的偶然表现。

02

实验:五个 Benchmark 上

的效率全景图

为了全面评估 TIR 效率,作者在数学推理、竞赛数学、事实问答、多学科复杂问答五个代表性 benchmark 上进行了系统实验。

参测模型覆盖了当前主流开源工具模型,包括 Qwen2.5/3 系列、Llama-3.1、DeepSeek-V3.1-Terminus、GLM-4.5、GPT-OSS-120B 等。

发现一:同准确率下,PTE 可相差一个数量级

在AIME24上的结果显示,多个模型准确率均集中在70%左右,但平均PTE从 103 到 105 跨越两个数量级。这意味着在准确率指标下表现相近的模型,其真实硬件成本可能存在显著差异。

图片


发现二:推理模式(Thinking)的效率具有任务依赖性

Qwen3-235B-Thinking在调用Python工具解决 AIME25(高难度竞赛题)上相比Instruct版准确率提升16.7%,PTE仅增加1.8倍,投入产出比合理。

然而,在调用Search工具解决 SimpleQA(事实检索任务)上,Thinking模式导致准确率下降3.4%,PTE却增加4.2倍。这表明在简单工具调用任务上启用深度推理模式可能导致过度思考(Over-thinking),既增加计算开销,又可能引入不必要的推理偏差。

图片

发现三:错误轨迹比正确轨迹更"贵"

论文对比了正确轨迹与错误轨迹的PTE分布,在五个benchmark上均呈现一致规律:得出错误答案的推理路径,其PTE显著高于正确路径。

分析表明,错误轨迹通常伴随以下行为:反复调用工具获取无关信息、对已有工具输出的冗余重解释、因格式错误导致的多次重试。这些行为共同推高了累积上下文长度    ,进而通过PTE的  项放大整体成本。

图片

03

四种TIR低效模式分析

图片

基于PTE的量化能力,作者进一步识别了四种典型的效率瓶颈:

模式一:Confirmatory Tool Use(验证式工具使用)


模型在内部推理中已得出答案(如通过链式思考解出数学题),但仍调用Python工具进行验证。这种"先推理后验证"的策略导致首步生成长篇推理文本,随后工具调用又引入新的长响应,双重膨胀上下文。

典型案例:Qwen3-235B-Thinking在AIME24上已手动推导出条件概率 1/115  和最终答案 m+n=116 ,仍调用Python执行 math.comb 和 Fraction 进行验证。该验证未提供新信息,但使轨迹PTE增加1.77倍。

模式二:Tool-Mixing(工具混用)


在WebInstruct-Verified上,多数模型倾向于单一工具策略(仅Search或仅Python)。DeepSeek-V3.1-Terminus展现了多工具交替使用能力,但实验显示该能力未带来准确率提升,反而因频繁的上下文切换和中间结果累积,导致PTE升高2.42倍。这提示多工具协同能力不等于高效推理,无约束的工具切换可能带来额外开销。

图片


模式三:Lack of Tool Priors(工具先验缺失)


Qwen2.5-7B-Instruct在AIME24上的案例显示:模型调用Python工具但生成的代码未包含 print() 语句,导致工具返回空输出(stdout: \n\n stderr: ``)。模型只能基于空结果继续推理,最终给出错误答案。

该案例表明,模型在预训练阶段对特定工具接口(如"需通过print输出结果")的暴露不足。工具调用能力不仅取决于模型是否"会调用",还取决于是否掌握工具的具体接口规范。

模式四:Tool Format Collapse(工具格式坍塌)


Tongyi-DeepResearch在SimpleQA上的实验显示,当系统提示中的工具名从 search 改为 google_search_tool 时,模型陷入格式幻觉,反复输出训练时的旧格式(如 <tool_call>{"name":"search"}),导致解析器持续报错。该模型在SimpleQA的100%轨迹中均出现格式坍塌,PTE高达63154(同任务下Llama-3.1-70B为1187)。这表明部分TIR模型对工具格式的掌握依赖于记忆而非理解,对非语义变化的鲁棒性不足。

04

讨论与启示

这项工作表明,"使用更多工具"并不等同于"更高质量的回答"。高PTE往往与低正确率共存:当模型对问题不确定时,倾向于通过反复调用工具进行试探,这种行为既增加成本,又未必提升准确率。PTE可作为粗粒度诊断信号——若推理轨迹的PTE异常偏高,可能意味着模型正陷入冗余或错误的推理循环。

对Agent开发者而言,该研究提供以下实践启示:

优化工具响应长度:对搜索、浏览等工具返回的结果进行压缩或结构化摘要,避免将原始长文本直接追加至上下文;

降低KV-Cache失效:在架构层面支持跨工具调用的缓存持久化(如Continuum Serving),减少prefill重复计算;

优化工具使用策略:通过强化学习或监督微调,抑制验证式调用和无意义混用,培养"单次精准调用"的行为模式。

05

结语

随着TIR从实验室走向工业部署,效率与准确率同等重要。PTE指标将硬件层面的prefill-decode不对称性纳入TIR评估体系,提供了更接近真实物理延迟的成本度量。四种低效模式的识别,不仅解释了部分SOTA模型在真实场景中推理成本过高的原因,也为下一代Agent的训练与部署指明了优化方向。

文章标签智能体学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多