Token导航 LogoToken导航

ExpVoyager让AI智能体学会翻旧账而非死记硬背

更新时间 2026-10-09来源 科技行者正文 8368字阅读约 27分钟

你有没有遇到过这种同事:刚入职时给他做了一份工作手册,写得特别详细,结果半年后你发现,手册里教的那些方法早就过时了,可真正管用的经验反而没写进去。因为写手册那天,谁也不知道半年后会遇到什么问题。

这正是当下所有"会学习的AI智能体"面临的尴尬处境。

一、一个提前写好的说明书,注定漏掉重要的东西

现在让大语言模型(LLM)去执行复杂任务,比如在虚拟房间里找东西、逛网上商城买衣服、做科学实验,已经不是什么新鲜事了。但光靠模型自身的"聪明"是不够的,因为任务场景千变万化,模型需要额外的指导。

这时候就出现了一个概念,叫智能体技能(Agent Skill):一套写好的操作指南、注意事项和经验总结,用来指导AI怎么完成任务,而不需要重新训练模型本身。

问题来了。现在主流的做法是,让AI先把过去做任务时积累的经验,提前整理成固定的技能文档,存起来备用。听起来挺合理的对吧?但这里藏着一个根本性的矛盾:你在整理经验的时候,根本不知道未来会遇到什么任务。

这就好比你搬家前打包行李,你永远猜不准新家会用到哪些东西。你可能把冬天穿的羽绒服都扔了,因为"应该用不上",结果搬到一个冬天特别冷的城市;你可能把十年前的旧教材都留着,因为"说不定以后能用上",结果占了一堆地方却再也没翻开过。提前打包这件事本身,就意味着你必须在信息不全的情况下做取舍,而做取舍就一定会出错。

研究团队做了个实验来验证这个直觉。他们先让AI在ALFWorld这个虚拟家居环境里反复尝试完成任务,收集了大量的成功和失败记录,然后用这些记录人工提炼出"标准答案技能",也就是论文里说的**oracle skill**

**oracle skill*:经过反复验证确实有效的、针对特定任务的技能文档,用作评判其他方法好坏的参照标准。

接着,他们检查现有的三种主流方法(AWM、Trace2Skill、ReasoningBank)构建出来的技能文档里,到底保留了原始经验里多少有用的知识。结果很扎心:表现最好的方法也只保留了40.9%的关键知识,换句话说,超过一半有用的东西在整理阶段就已经丢了。

这还不是最麻烦的。研究团队又测试了另一个问题:就算你不提前整理,而是等任务来了再去"翻找"相关的历史经验,现在的检索方法效果怎么样?他们用的是常见的相似度检索,也就是找和当前任务看起来最像的历史记录。结果发现,就算检索深度拉到20条记录,知识召回率也只在30%左右徘徊,而且检索越多,混进来的无关信息就越多,精准度反而往下掉。

这说明一个问题:靠"看起来像不像"来找经验,本身就是个不靠谱的筛选标准。有些任务表面上很不一样,但底层用得上的操作技巧却是相通的;有些任务表面上很像,但真正管用的细节可能藏在完全不同的角落。

二、与其翻手册,不如直接进档案室翻箱子

搞清楚问题出在哪之后,研究团队提出了一个思路上的转变:与其提前把经验压缩成一份固定手册,不如让AI在真正面对新任务的那一刻,亲自去"翻档案",主动决定去看哪些历史记录、看到什么程度。

这就是这篇论文的主角,**ExpVoyager**

**ExpVoyager*:一个让AI智能体动态浏览历史经验、按需合成技能的框架,核心是把技能生成从"提前打包"改成"现场翻找"。

这个框架里有一个角色叫**技能策展人(skill curator)**

**技能策展人*:负责浏览历史任务记录、提炼有用知识、最终写出技能文档的那个AI角色,它自己不执行任务,只负责“备课”。

策展人写完技能文档之后,会交给另一个负责实际执行任务的AI,论文里叫它**执行者(executor)**

**执行者*:真正在环境里做动作、完成任务的AI,它的参数是冻结的,不会因为这次经验浏览而改变,靠策展人给的技能文档来临时“充电”。

这个分工挺有意思的,策展人像是图书馆管理员,执行者像是来查资料写论文的学生。学生不需要自己去翻遍整个书库,管理员会根据学生这次要写的题目,主动帮他找出最相关的那几本书、那几页内容,整理成一份阅读清单。

如果没有这个分工会怎么样?执行者自己一边做任务一边翻找历史记录,会严重拖慢任务执行的节奏,而且执行者的注意力全在当下的动作决策上,很难同时兼顾"哪些历史经验值得参考"这种更抽象的判断。分工之后,策展人可以专心做检索和整理这件事,执行者专心把动作做对,两边互不干扰。

三、给AI装一个可以变焦的放大镜

策展人怎么翻档案?这里研究团队设计了一个叫**可导航接口(Navigable Interface)**的东西。

**可导航接口*:让策展人能够以不同的“视角”和“分辨率”查看历史任务记录的工具接口,既能看全局,也能看细节。

为什么需要这个?因为有用的知识可能藏在轨迹的不同层面。举个例子,如果你想知道"整理房间应该先擦桌子还是先扫地"这种顺序问题,你需要看整个流程的全貌,也就是论文里的**轨迹级视图(trajectory-level view)**,包含完整的动作序列、最终结果这些宏观信息。但如果你想知道"擦桌子这个动作具体要用什么工具、在什么条件下才能执行",你就需要放大到**步骤级视图(step-level view)**,看某一步的具体观察、AI当时的推理过程、执行的动作和立即得到的反馈。

这就像你在看一张地图。有时候你需要看整个城市的路网图,判断该走哪条主干道;有时候你需要放大到某个路口,看清楚红绿灯和车道标线该怎么走。如果你手里只有一种固定比例尺的地图,要么是宏观信息太粗放导致走错路口,要么是细节图太琐碎让你迷失方向感。可导航接口的价值,就是让策展人可以自由切换比例尺,该看全局的时候看全局,该抠细节的时候抠细节。

具体操作上,策展人有两个工具可以用。一个叫**search_exp**,可以指定看哪个层级的视图、搜索哪些字段、用什么样的正则表达式模式去匹配,相当于在档案室里按关键词精确检索。另一个叫**inspect_traj**,如果搜到了一条有意思的记录,但只看这一条不够,还想知道这条记录前后发生了什么,就可以用这个工具把整条历史轨迹完整展开来看,按时间顺序回放整个过程。

这两个工具配合起来使用,就是策展人反复在"精确定位"和"展开上下文"之间切换,一步步把散落在各处的知识碎片拼成完整的理解。

四、光会翻箱子还不够,还得记得自己翻到哪了

如果策展人每次搜索都是独立的、互不关联的,那问题就来了:翻了半天档案,翻完就忘,下一次搜索又从零开始,完全不知道之前已经确认了什么、还差什么没搞清楚。

这就好比你去图书馆查资料写报告,如果每次翻完一本书就把笔记全扔了,下次进图书馆还是两眼一抹黑,不知道哪些内容已经查过了、哪些疑问还没解决,你可能会把同一本书反复翻好几遍,却始终拼不出完整的报告框架。

为了解决这个问题,研究团队设计了**导航状态(Navigation State)**

**导航状态*:策展人在浏览过程中持续维护的一个“备忘录”,记录已经确认的知识和还没搞清楚的疑问,每轮浏览后都会更新。

这个备忘录分成两部分,一部分叫**知识条目(Knowledge Items)**,记录目前已经从历史经验里提炼出来、可以迁移到当前任务的可靠知识;另一部分叫**开放问题(Open Questions)**,记录目前还没弄明白、需要继续查证的疑点。

这里有一个特别值得说的细节。策展人在看到历史记录的时候,会很小心地区分"这件事在过去那次任务里发生过"和"这件事在当前任务里也一定成立"。举个论文里的例子,某次任务是"把报纸放到沙发上",策展人翻到一条历史记录,发现报纸是在某个咖啡桌上找到的。但当前任务的环境描述里根本没有提到咖啡桌这个家具。这时候策展人不会草率地下结论说"报纸就在咖啡桌上",而是把这条经验转化成一个更抽象、可迁移的知识:如果找不到咖啡桌,就依次检查扶手椅、边桌这些常见的替代位置。同时它会把"当前环境里到底有没有报纸、报纸具体在哪"标记成一个"未知项",留到执行阶段去实际验证。

这种区分特别关键。如果不做这种区分,AI很容易把过去某一次的具体细节,当成放之四海皆准的事实,结果在新环境里死板地按照旧经验去找一个根本不存在的东西。导航状态就是靠这种持续更新、持续修正的机制,让策展人一边翻箱子一边梳理思路,越翻越清楚,而不是翻得越多反而越乱。

论文里有张图(Figure 10)具体展示了这个更新过程。策展人看到一条新的历史记录后,会重新评估已有的知识条目,把源自具体情境的观察和可以迁移的规则区分开,同时给开放问题标注优先级,比如某个问题从"高优先级"升级成"紧急",因为它直接关系到任务能不能完成。

五、翻够了就该收工,写一份量身定制的说明书

浏览过程不是无限进行下去的,策展人会持续这个"搜索、看结果、更新备忘录"的循环,直到备忘录里的信息已经足够支撑写出一份靠谱的技能文档,或者达到了预先设定的轮次上限(论文里默认是20轮)。

最后一步是**技能合成(Skill Synthesis)**,策展人把整个导航状态里积累的知识,转化成一份给执行者看的skill.md文档。这份文档不是简单地罗列信息,而是把还没有验证的条件写成"执行时需要检查的事项",把过去踩过的坑写成"注意事项和补救方案"。

论文里给了一个具体样例,还是"把报纸放到沙发上"那个任务。最终生成的技能文档里写着:优先检查咖啡桌,如果找不到就系统性地检查扶手椅、边桌这些备选位置,不要在同一个家具上反复兜圈子;如果导航到咖啡桌失败或者手里始终没拿到东西,立刻扩大搜索范围。这些内容看起来平平无奇,但它精确对应了策展人在浏览过程中反复确认、反复修正得出的结论,而不是凭空编造的通用建议。

六、这套方法到底管不管用

光说思路好没用,得看实际效果。研究团队在三个经典的智能体测试环境上做了实验:ALFWorld(虚拟家居任务)、WebShop(网购模拟)、ScienceWorld(科学实验模拟)。

对比的基线方法包括AWM(工作流记忆)、ReasoningBank(推理记忆库)、Trace2Skill(轨迹合并技能)和SkillTTA(一种测试时技能合成方法)。

结果显示,用Qwen3.5-9B同时作为策展人和执行者时,ExpVoyager在ALFWorld上的成功率达到63.7%,而基础的ReAct智能体(不用任何技能)只有41.4%,表现最好的基线方法SkillTTA也只有51.1%。在WebShop上,ExpVoyager的得分是61.2分,基线里最好的AWM只有52.0分。ScienceWorld上ExpVoyager拿到47.0分,同样领先所有基线方法。

更有意思的是,ExpVoyager不仅让任务完成率更高,还让执行步数变少了。这说明合成出来的技能文档不只是"能完成任务",还让AI少走了很多弯路,执行得更利索。

换用更大的模型Gemma4-31B做执行者,结果依然一致。ExpVoyager把成功率从53.9%(基础智能体)拉到69.6%,比表现最好的基线SkillTTA还高出7个百分点。研究团队还测试了用不同规模的模型做策展人,发现哪怕用一个更小的模型(Qwen3.5-9B)去当策展人,指导一个大得多的执行者(Gemma4-31B),效果依然很好,甚至比不用任何技能指导要强出15.7个百分点。这说明一件事:告诉AI该参考哪些历史经验,有时候比AI自身有多聪明更重要。

七、经验越攒越多会不会反而添乱?

这里有个很实际的问题,AI在实际部署中,经验是慢慢积累起来的,不是一开始就有一大堆现成的历史记录。研究团队专门设计了一个"在线场景"来模拟这个过程:一开始完全没有历史经验,任务一个接一个来,每完成一个任务,就把这次的经验积累进档案库,供后续任务参考。

结果发现一个挺诚实的现象:当积累的经验还很少的时候,ExpVoyager的表现提升有限,甚至有时候还不如基线方法,因为没什么"箱子"可翻,翻找这个动作本身的价值也发挥不出来。但随着经验越攒越多,ExpVoyager开始持续爬升,而那些依赖提前打包好技能的基线方法却逐渐进入了瓶颈期,涨幅越来越小甚至开始停滞。到任务流程走完的时候,ExpVoyager在ALFWorld上比基础智能体累计提升了15个百分点,在ScienceWorld上更是拉开到18个百分点的优势。

这个现象背后的原因其实很直观。提前打包技能的方法,每次新增经验都要重新做一遍"提炼压缩"的工作,经验越多,压缩过程中丢失的信息也就越多,甚至可能因为噪声增加而拖累整体质量。而ExpVoyager是按需翻找的,档案库越大,可供挖掘的知识就越丰富,只要翻找的策略够精准,就能持续从新增的经验里挖出有用的东西。

研究团队还专门做了个对照实验,验证这个"越多越好"的趋势。他们控制变量,让所有方法使用完全相同的历史经验子集,逐步从10%扩大到100%的规模。结果显示,几个基线方法的表现随着经验增多反而下降了,而ExpVoyager则稳步上升,优势随着规模扩大变得更明显。这就好比一个新手厨师和一个经验丰富的大厨同时面对一大堆各种各样的食材,新手厨师可能会被选择淹没、无从下手,甚至做出一道四不像的菜,而经验丰富的大厨反而能从丰富的食材里精准挑出最适合这道菜的那几样,食材越多,他反而越有底气。

八、这套系统会不会白白浪费计算资源?

这里有个自然而然的质疑:ExpVoyager需要策展人反复搜索、反复更新备忘录,这肯定要消耗不少计算资源(论文里用token数衡量)。会不会说到底,ExpVoyager的优势只是靠"花更多钱、查更多次"堆出来的?

研究团队专门设计了对照实验,来回答这个疑问。他们拿ExpVoyager和一种叫"智能体式搜索(agentic search)"的方法做对比,这种方法模拟的是现在检索增强生成领域常见的做法:反复做相似度检索、根据检索结果调整下一次的搜索关键词,本质上还是一种被动的相似度匹配,只不过多迭代了几轮。

在消耗差不多token预算的前提下,ExpVoyager的表现始终领先这种迭代式检索方法。更值得注意的是,随着预算增加,基线方法的提升很快陷入停滞甚至倒退,而ExpVoyager能一直受益到大约20轮左右,超过这个点之后才开始出现性能下滑。

这个结果说明的道理挺朴素:有没有用不在于你翻了多少次箱子,而在于你翻箱子的方式对不对。相似度检索这种方式,翻得越多混进来的杂音就越多;而主动导航这种方式,因为有导航状态在持续引导"接下来该查什么",所以能更精准地命中真正有用的信息,而不是在原地打转。

九、旧技能和新方法能不能合作,而不是二选一

现实中的AI系统往往已经积累了不少提前准备好的技能库,把这些全部推翻重来显然不划算。研究团队于是测试了一个更贴近实际应用的问题:ExpVoyager能不能和已有的技能库配合使用,而不是完全取代它们?

答案是可以,而且效果相当不错。具体做法是,把已有的技能文档作为浏览的起点,让ExpVoyager在这个基础上继续针对当前任务做补充和精修。结果显示,这种"旧技能打底、新方法精修"的组合方式,相比单独使用ExpVoyager,不仅任务表现更好(在WebShop上成功率提升幅度最高达到50.7%),消耗的计算资源反而更少。

这个发现的实际意义挺大的。它说明提前准备的技能库不需要面面俱到,不用绞尽脑汁去覆盖所有可能出现的场景变体,只要打好一个基础框架,剩下的细节可以留给ExpVoyager在真正遇到具体任务的那一刻去按需补齐。这就像装修房子的时候,不需要提前把每个房间的家具摆放位置都精确规划好,先把水电和基础布局做好,家具怎么摆可以等真正搬进去住的时候再根据实际生活习惯来调整。

十、这套方法为什么能成,靠的是哪两个部件

研究团队还做了消融实验,把可导航接口和导航状态分别拿掉,看看各自到底贡献了多少。

拿掉可导航接口之后,策展人只能靠通用的文本搜索工具(类似grep命令)去翻找原始记录,成功率从63.7%掉到55.3%。拿掉导航状态之后,策展人虽然还能用完整的接口去搜索,但搜索完不再系统性地整理成知识条目和开放问题,只是简单堆积历史,成功率掉到58.9%。

研究团队进一步分析发现,拿掉接口之后,知识召回率明显下降,而且检索到的内容里混进了更多无关信息(占比高达52%)。拿掉导航状态之后,虽然接口本身还在,但因为没有机制去追踪"哪些已经查过了",策展人会反复访问重复的知识(占比达到47%),真正探索到的新知识比例明显偏低。

这两个部件的分工其实挺清楚的:可导航接口负责让策展人"看得准",导航状态负责让策展人"记得住、不绕圈"。少了前者,翻箱子翻得很盲目;少了后者,翻箱子翻得很低效,两者缺一不可。

十一、这个方法还有哪些没解决的问题

研究团队也很坦诚地列出了几个失败案例。

第一个问题出在把知识压缩成最终技能文档的那一步。有个任务是把两个遥控器都放到脚凳上,浏览过程中策展人明明已经确认了"应该拿一个放一个,交替进行"这个顺序要求,但最终生成的技能文档却写成了"先把两个遥控器都拿到手,再统一放置",结果执行者一直在到处找第二个遥控器,却始终没有触发放置动作。这说明就算浏览阶段搞清楚了正确的顺序逻辑,压缩成最终文档的时候,这种顺序约束也可能在信息整合的过程中被弄丢。

第二个问题是执行状态发生变化之后,条件是否需要重新核实。有个网购任务要求买一件特定颜色和尺码的蝙蝠侠衬衫,执行者一开始确实选中了正确的选项,但后来离开这个商品页面又重新进入,最终下单的时候却没有重新点选那些选项,导致订单信息是空的。这暴露出一个更深层的问题:过去某个时间点选中了某个选项,并不代表这个选择在后续操作里始终有效,尤其是当页面被重新加载之后。

第三个问题是知道该做什么,但不知道该怎么落实成具体动作。有个科学实验任务要求做一份花生酱果酱三明治,策展人已经在浏览过程中正确识别出"所有原料必须放进同一个容器才能混合"这个关键条件,但生成的最终技能文档里给出的操作指令却是错的,写成了直接对着厨房这个大范围执行混合命令,而不是先把原料转移到一个具体的容器里。结果执行者不断尝试混合厨房,却始终没有完成把原料集中到容器这一步。

这几个失败案例其实挺有启发性的,它们说明"知道正确答案"和"能把正确答案转化成可执行的具体步骤",中间还隔着一段距离,而这段距离恰恰是这套系统目前还没能完全跨过去的。

写在后面

读完这篇论文,我最触动的地方其实不是ExpVoyager的成功率有多高,而是那三个失败案例。它们诚实地暴露了一件事:让AI"知道"正确的知识和让AI"正确地执行"这个知识,中间隔着一道很深的沟。策展人能精准识别出"两个遥控器要交替放置"这个规则,却在写最终文档的时候把它弄丢了。这不是知识检索的问题,而是知识压缩和表达的问题,某种程度上跟人类写文档时的经验也很像,你脑子里想得很清楚的一件事,写成文字的时候反而容易表达走样。

还有一个细节值得单独拎出来说。论文里那个"重新进入商品页面后忘记重新选择选项"的失败案例,本质上是一个"状态失效"的问题。AI把过去某一时刻确认过的信息,当成了永久有效的事实,但现实世界里很多状态是会因为你的动作而重置的。这让我联想到人在使用网购App时也会犯类似的错误,你选好了商品规格,中途去看了别的商品,回来结算的时候没注意规格被重置了,结果买错了尺码。人类和AI犯的是同一种错误,只不过人类靠的是习惯性的"回头再确认一遍",而AI目前还没有这种主动复核的本能。

这篇论文另一个让我意外的地方是,它没有回避自己的局限性,反而用大量篇幅详细展示了失败案例的具体过程,包括策展人在哪一轮的推理出了偏差,最终文档在哪一句话上出了问题。这种透明度在AI研究论文里其实不算特别常见,也让这套方法的可信度反而更高了一些。

Q&A

Q1:ExpVoyager是什么?

A:ExpVoyager是一个让AI智能体动态浏览历史任务经验、按需合成技能文档的框架,核心思路是把技能生成从提前打包改成任务来临时现场翻找,避免提前压缩经验时丢失关键知识。

Q2:ExpVoyager和传统的技能提取方法有什么区别?

A:传统方法(如AWM、ReasoningBank)在任务需求未知时就把经验压缩成固定技能,容易丢失后续变得关键的知识;ExpVoyager则在每次面对具体任务时才去主动检索、整理相关经验,检索更精准,知识保留更完整。

Q3:ExpVoyager能和已有的技能库一起用吗?

A:可以。研究显示把已有技能库作为起点让ExpVoyager继续补充精修,比单独使用ExpVoyager效果更好,消耗的计算资源也更少,适合已经积累技能库的实际部署场景。

文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多