Token导航 LogoToken导航TokenDH.com

北卡罗来纳大学教堂山分校、德克萨斯大学奥斯汀分校与微软研究院联手,让AI智能体学会“心里没底时承认没底”

更新时间 2026-05-19来源 科技行者正文 9283字阅读约 30分钟

这项由北卡罗来纳大学教堂山分校主导,联合德克萨斯大学奥斯汀分校与微软研究院的研究,以预印本形式于2026年5月12日发布在arXiv平台,论文编号为arXiv:2605.11436。感兴趣的读者可通过该编号查询完整论文。

说到底,我们每个人每天都在做一件事:在信息不完整的情况下做决定。你早上出门前看了眼窗外的天色,不确定今天会不会下雨,于是决定随手拿上一把伞。你没有看过一整天的气象卫星数据,但你的大脑会根据目前看到的线索,给出一个大概的判断,并据此采取行动。这种在不确定中做决策的能力,人类早已习以为常,但对于人工智能来说,却一直是个顽固的难题。

现在,来自上述几所机构的研究团队提出了一个名叫 Agent-BRACE 的方法,试图教会AI智能体做同样的事情:不仅要知道自己知道什么,还要明确知道自己不知道什么,然后在这种模糊状态下做出合理的行动。这听起来简单,但背后的技术挑战却相当深刻。

一、为什么AI智能体会在漫长任务中"迷失自我"

要理解这项研究解决的问题,可以用一个简单的比喻来铺垫。假设你是一位侦探,正在调查一个复杂的案件。案件发生在一栋你从未进过的大楼里,你只能每次进入一个房间,观察那个房间里的线索,然后退出来决定下一步去哪里。你无法同时看到所有房间,也无法确定某个房间里的东西是否还在原位,因为有人可能在你离开后移动了东西。

这正是AI智能体在所谓"长时程部分可观测任务"中面临的处境。"长时程"意味着任务需要很多步骤才能完成,就像一个跨越多天的复杂案件;"部分可观测"意味着智能体在任何时刻都只能看到当前所在"房间"里的信息,看不到整个"大楼"的全貌。在数学和计算机科学领域,这类问题有一个专门的名字,叫做"部分可观测马尔可夫决策过程",英文缩写是POMDP。

现有的大语言模型(也就是ChatGPT、Qwen这类能理解和生成自然语言的AI)在担任这类任务中的智能体时,遇到了两个核心麻烦。第一个麻烦是记忆成本的爆炸性增长。AI要完成任务,必须记住此前所有的观察和行动,这些信息组成了一条越来越长的"历史轨迹"。每走一步,这条轨迹就变长一点,AI需要处理的文字就多一点。随着任务进行到几十步、上百步,这个"历史档案"会变得极其庞大,不仅占用大量计算资源,更严重的是,真正关键的信息会被淹没在大量无关细节里,就像一份案件卷宗里,关键的指纹证据被埋在成百上千页无关口供中间,找起来非常费力。

第二个麻烦更加根本:AI不知道该如何在文字中表达"我不确定"。在经典的POMDP理论里,有一个优雅的解决方案叫做"信念状态"——它不是一个确定的答案,而是对所有可能状态的概率分布。通俗地说,就像侦探手中的一块白板,上面写着"嫌疑人A的可能性是60%,嫌疑人B是30%,嫌疑人C是10%",而不是直接下结论说"就是A干的"。对于传统计算机系统,这种概率分布可以用数字精确表示,但对于用自然语言工作的大语言模型来说,如何把这种不确定性编码进一段文字,从来都不是一件显而易见的事。

以往的处理方式主要有两种,但两种都有明显缺陷。第一种方式是让AI直接把所有历史记录都塞进上下文,像背着一个越来越重的背包——随着任务推进,背包的重量线性增长,最终超出AI所能处理的上限。第二种方式是让AI把历史信息"压缩"成一段摘要性文字,就像把那份厚厚的案件卷宗缩写成一页纸的案情简报。这样做确实缩短了文字长度,但问题在于,摘要是一个"确定性"的陈述——它告诉AI"现在的情况是这样的",而不是"现在的情况大概是这样,但有些地方我还不确定"。一旦用摘要代替历史,不确定性就悄悄消失了,就好像侦探把所有证据都替换成了一个斩钉截铁的结论,但这个结论可能是错的,而且侦探自己不知道它可能是错的。

二、"我确定"与"我觉得可能":一把描述不确定性的精细刻度尺

Agent-BRACE 的核心创意,在于为AI找到一种既能压缩历史信息、又能保留不确定性的表达方式。研究团队的灵感来自一个人类已经使用了几十年的工具:估计性概率词汇表,英文缩写是WEP,全称是"Words of Estimative Probability"。

这个词汇表最初由情报分析领域发展而来,核心思想非常朴素:当你不能给出精确的数字概率时,你可以用有层次的自然语言词汇来表达不同程度的把握。在Agent-BRACE里,这套词汇被精确地定义成七个层级,从最确定到最不确定依次是:confirmed(确认)、almost certain(几乎确定)、probable(很可能)、possible(有可能)、unlikely(不太可能)、doubtful(存疑)、unknown(未知)。

这七个词就像温度计上的七个刻度,让AI在描述自己对世界状态的认知时,不必在"完全确定"和"完全不知道"之间二选一,而是可以精细地表达出"我观察到了这个所以非常确定"、"我推测大概是这样但没有直接证据"、"这件事我完全没有信息来源"等不同程度的把握。

研究团队把使用这套词汇生成的信念描述叫做"WEP标注的信念状态"。具体形式是一组原子性陈述句,每句话描述环境状态的一个独立方面,并附带一个WEP级别的把握度标签。举个例子,当智能体正在一个文字冒险游戏里探索时,它的信念状态可能长成这样:当前所在地点是工作室,这是confirmed(确认)的,因为刚刚的观察直接说了这一点;工作室有一个通往北边的出口,这是probable(很可能)的,因为之前的探索暗示了这一点;跳蚤窝的位置是unknown(未知)的,因为还没有任何相关信息。

这种表达方式有三个好处。首先,每个陈述都是原子性的,也就是说每句话只说一件事,这让后续做决策的模块能够快速定位和提取关键信息,不用在一大段连续文字里翻来找去。其次,整个信念状态的长度是相对稳定的,不会随着任务步骤增加而线性膨胀,因为新的信息会更新已有的陈述,而不是追加到一个越来越长的列表后面。第三,也是最关键的,不确定性被显式地保留下来,AI知道自己知道什么,也知道自己不知道什么,这为后续在不确定状态下采取合理行动提供了真正的基础。

三、侦探助手与行动专家:把一个AI拆成两个分工合作的角色

除了引入WEP词汇表这个核心创意,Agent-BRACE 还在系统架构上做了一个重要设计:把一个通常由单一模型承担的AI智能体拆分成两个独立但协同工作的模块。

第一个模块叫做"信念状态模型",可以理解为专职的侦探助手。它的职责是接收最新的观察信息,结合之前已有的信念状态,更新出一个新的信念状态。它的输入是三样东西:总体目标、上一步的信念状态、以及最新的环境观察;它的输出是一个更新过的信念状态,同样是一组带有WEP标签的原子陈述句。它只负责"世界现在是什么样"这个问题,绝对不生成"下一步该做什么"这类行动建议。研究团队在设计时特别强调了这条禁令,以确保信念状态的纯粹性——它是对客观世界状态的估计,不能被主观意图或行动计划污染。

第二个模块叫做"策略模型",可以理解为专职的行动决策者。它的输入是总体目标、当前的信念状态、以及当前的观察;它的输出是下一步要执行的具体行动。关键在于,它不需要看完整的历史轨迹,只需要看由信念状态模型整理出的那组简洁的WEP标注陈述,就能做出决策。这相当于行动决策者不用翻阅厚重的案件卷宗,只需要看侦探助手整理好的一页情况简报,就能下达指令。

这种分工让整个系统在面对长达数十步、上百步的任务时,策略模型所需处理的信息量始终保持在一个相对固定的范围内,不会因为任务步数增加而陷入信息过载。

四、两个学生同时学习:靠"做任务拿奖励"来训练这两个模块

设计好系统架构之后,还有一个关键问题:如何训练这两个模块?研究团队采用的是强化学习中的PPO算法,可以理解为一种"靠不断尝试、从成功和失败中学习"的训练方式,而不是靠人工标注大量正确答案。

训练的核心逻辑是:两个模块在完成任务的过程中共同接受来自环境的反馈——任务成功就得+1分,失败就得0分。这个来自环境的奖励信号主要驱动策略模型的学习,让它逐渐学会什么情况下该做什么行动。

但仅靠任务成败来训练信念状态模型是不够的,因为信念状态的好坏不会立刻体现在下一步是否成功上,而是会以更间接的方式影响长远结果。为此,研究团队专门为信念状态模型设计了一套复合奖励系统,包含五个维度。

第一个维度叫"状态追踪奖励",衡量的是逻辑一致性:当新的观察到来时,信念状态有没有正确地更新?有没有把新信息纳入进来?有没有删除掉已经被新信息推翻的旧陈述?具体计算方式是统计新事实中被正确纳入的比例,同时减去那些明明被新观察推翻却仍然保留的"过期信念"占总陈述的比例。

第二个维度叫"状态正确性奖励",衡量的是与真实世界的贴合程度:信念状态中的每一条陈述,不仅内容要正确,附带的把握度标签也要合理。如果某件事已经有直接证据,却只标了"有可能",这也算部分扣分。这个奖励由一个更大的语言模型作为裁判来评估,具体使用的是参数量更大的Qwen3-30B-A3B-Instruct。

第三个维度叫"多样性奖励",防止信念状态模型陷入一个偷懒的策略:把所有陈述都标成同一个把握度级别。一旦所有陈述都标"确认"或者都标"未知",WEP词汇表的意义就消失了,不确定性的表达就失去了区分度。这个奖励鼓励信念状态中使用尽可能多的不同把握度级别,通过计算各级别分布的信息熵来量化。

第四个维度叫"格式奖励",这是一个守门员:确保信念状态符合规定的结构格式,不然其他三个奖励全部归零。这个设计防止了模型为了拿到某类奖励而生成格式混乱的输出。

第五个维度叫"折扣成功奖励",把任务最终结果传递给信念状态模型:任务成功时,给每一步的信念状态一个按时间打折扣的奖励,让信念状态模型明白,好的信念状态会间接帮助完成任务。

在正式开始强化学习训练之前,研究团队还做了一步预热:用GPT 5.4 mini生成了一批标准的信念状态样本,先对信念状态模型做有监督的微调。这一步的目的不是传授任务知识,而是教会模型"信念状态该长什么样"——结构格式和WEP词汇的基本用法。后续的分析证实了这一点:在微调完成后,格式遵守率立刻就达到了极高水平(超过96%),而状态正确性、多样性等实质性指标仍然很低,说明真正的任务知识是在后续强化学习阶段靠与环境交互习得的,而不是从微调教师那里继承的。

五、在文字游戏世界里检验这套方法的成色

研究团队选择了TextWorld这个平台来训练和测试Agent-BRACE。TextWorld是一个能自动生成各种文字冒险游戏的框架,智能体通过输入自然语言指令来控制角色移动、拾取物品、操作环境,通过文字描述获得观察。这类游戏天然就是部分可观测的——角色只能看到当前所在房间,看不到整个地图。

研究团队构建了三种不同的任务类型。第一种叫Quest,角色需要在多个房间组成的迷宫里导航,找到并操作特定物品,按正确顺序完成一连串的任务。第二种叫Treasure,角色被放置在随机生成的迷宫里,需要找到目标宝物,迷宫的大小和复杂度随关卡难度递增,训练用的是容易的关卡,测试用的是更难的关卡。第三种叫Cooking,角色需要在一个模拟家庭环境里找到食谱,收集食材,按照食谱正确地切割、烹饪食材,最后完成一顿饭,这种任务要求按特定顺序完成多个子目标,结构与前两种有明显差异。

一个关键的测试设计是:Agent-BRACE以及其他需要训练的对比方法,全部只在Quest任务上进行训练,然后直接在Treasure和Cooking上进行测试,完全没有针对这两种任务做任何专门训练。这是为了检验方法的泛化能力——学到的东西是否真的有通用性,而不只是对某一种任务的过拟合。

研究团队拿Agent-BRACE与六种对比方案进行比较。基础模型是未经任何针对性训练的原始语言模型,直接拿来做任务。ReAct是一种让AI在每步行动前先"边想边说"的方法,但使用完整的历史记录作为输入,不进行专门训练。Direct-Action(RL)是经过强化学习训练的版本,但没有信念状态机制,只是训练模型直接输出行动。ReAct(RL)是在强化学习训练的基础上加入边想边说机制,但同样使用完整历史。MEM1是一种专门设计用于压缩记忆的方法,通过摘要来管理历史信息。PABU是另一种信念状态框架,用结构化文字记录任务进展和过去的行动观察,但不包含不确定性表达。

研究团队使用了两种不同规模的基础语言模型来做测试:较小的Qwen2.5-3B-Instruct和稍大的Qwen3-4B-Instruct,两种型号的测试都证明了方法的有效性。

在Qwen2.5-3B-Instruct上,Agent-BRACE在三种任务上的平均准确率是72.8%,比最强的强化学习训练基准Direct-Action(RL)高出14.5个百分点。与只做摘要压缩的MEM1相比,提升幅度高达35.5个百分点。在Qwen3-4B-Instruct上,Agent-BRACE达到了79.3%的平均准确率,比最强基准Direct-Action(RL)高出5.3个百分点,比MEM1高出34.3个百分点。

从各子任务的表现看,Agent-BRACE在Treasure任务上迁移得最好,在两种模型下都达到了81%左右,这与Quest的导航结构相似有关。在结构差异最大的Cooking任务上,Agent-BRACE在Qwen2.5-3B-Instruct下达到58.5%,虽然低于Quest和Treasure,但仍然比大多数基准方法要好。一个值得注意的现象是,几乎所有不包含不确定性表达的方法在Cooking任务上都出现了明显的性能下滑,尤其是在Qwen3-4B-Instruct上,MEM1只有10%,ReAct(RL)只有13%,PABU只有32.5%,这说明Cooking任务的多阶段子目标结构对不确定性追踪的要求特别高,而基于摘要或进度追踪的压缩方式在这里彻底失效了。

在上下文长度控制方面,实验数据非常清晰地展示了不同方法的差异。随着游戏步数从0推进到100步,ReAct和Direct-Action(RL)的上下文长度呈现出典型的线性增长,最终超出设定的10K token上限。MEM1通过摘要也将上下文控制在相对平稳的水平。而Agent-BRACE的上下文长度始终维持在接近常数的水平,几乎不随步数增加而增长,这正是信念状态模型将历史信息提炼成固定大小WEP标注摘要的效果。更关键的是,在同样维持了相对稳定上下文长度的条件下,Agent-BRACE的最终任务完成率是78.5%,而MEM1只有28.5%,Summary-Belief(另一种摘要方式,但不包含不确定性表达)只有60.4%。这个对比清楚地说明,上下文长度控制本身只是必要条件,真正起作用的是那套WEP不确定性标注带来的信息质量提升。

研究团队还把Agent-BRACE应用在另一个完全不同的测试场景上:ALFWorld。这是一个基于真实家庭场景的任务环境,要求智能体执行拿取、清洁、加热、冷却、放置等多步物品操作,动作类型和观察结构都与TextWorld明显不同。在这个场景下,Agent-BRACE(Qwen3-4B-Instruct版本)同样表现出色,达到30.7%的准确率,比最强的强化学习基准Direct-Action(RL)高出2.85个百分点,比基础模型高出6.42个百分点,比MEM1高出约5个百分点。这说明结构化信念表达的效果具有跨任务的通用性,不只是对特定游戏结构的特化适应。

六、从21%到52%:信念会随着经历的积累越来越准确

研究团队对训练好的Agent-BRACE做了一项颇具洞察价值的深入分析:追踪在任务执行过程中,信念状态的把握程度分布如何随步数变化,以及这种把握程度的分布是否与现实相符。

用来衡量准确程度的工具叫做布里尔分数,这是一种在气象预报评估领域广泛使用的校准指标。把每个WEP级别对应到一个数值概率(比如confirmed对应1.0,probable对应0.75,possible对应0.50,doubtful对应0.25,unknown对应0.0),然后与该条陈述是否确实为真进行比较,就能算出一个校准误差分数。分数越低代表越准确,0分代表完美校准,0.25分代表与随机猜测相当。

实验结果显示,在任务开始(第0步)时,布里尔分数约为0.40,处于较高的误差水平,说明此时信念状态的把握程度标注与实际情况偏差较大。随着任务推进,这个分数持续下降,到第14步时降至约0.28,全程降低了约0.12分,并始终低于0.25的随机基线。与此同时,标注为confirmed(确认)的陈述占比从最初的21%增长到了52%,反映出随着证据不断积累,越来越多的不确定状态被直接观察所确认。

从不同WEP级别的校准情况来看,有一个一致的规律:信念状态模型整体上是"偏保守"的,也就是说它倾向于给某件事情标注比实际应有把握更低的级别。在早期训练阶段,标注为unknown的陈述中有68%实际上是真的,说明模型在没有充分理由时会过度使用"未知"这个最低把握级别。到了后期训练阶段,这个比例降到了54%,说明模型学会了更合理地分配把握度标签。在高把握度端,almost certain和confirmed这两个级别在整个训练过程中都保持了很高的实际准确率,分别在91%和95%以上。

研究团队特别指出,"偏保守"比"过度自信"是一种更安全的失败模式。一个过度自信的智能体会基于一个它认为完全确定、实际上可能是错误的世界模型采取不可逆的行动;而一个偏保守的智能体则会继续探索和收集证据,最终有机会纠正自己的认知。

七、拆零件检验:如果去掉某一部分会怎样

为了验证系统中每个组件的实际作用,研究团队做了系统性的消融实验,逐个去掉某个关键部分,观察性能如何变化。

其中破坏性最大的一个去掉操作,是把完整的七级WEP词汇表压缩为只有两级:confirmed和unknown。这相当于把精细的温度计换成只能显示"热"和"冷"的简单开关。在Qwen3-4B-Instruct上,这一变化使平均准确率从79.3%跌到65.3%,下降了整整14个百分点。在Qwen2.5-3B-Instruct上,下降幅度也有4.5个百分点。这直接证明了把握度表达的颗粒度对实际决策性能的影响是实质性的,不是锦上添花,而是核心组件。

另一个影响同样巨大的操作是冻结信念状态模型,只训练策略模型。在Qwen2.5-3B-Instruct上,这导致平均准确率从72.8%跌到51.3%,下降超过21个百分点。在Qwen3-4B-Instruct上,下降幅度更是达到22.6个百分点。这说明信念状态模型和策略模型必须联合训练,信念状态必须通过与策略模型的协同优化来学会生成真正有用于决策的表征,单纯靠预训练初始化是远远不够的。

把信念状态模型替换成只做摘要(Summary-Belief)导致了最剧烈的性能下滑:在Qwen2.5-3B-Instruct上平均准确率从72.8%跌到39.4%,下降33.4个百分点;在Qwen3-4B-Instruct上从79.3%跌到45.3%,下降34个百分点。Cooking任务上的下滑尤为惨烈:在Qwen2.5-3B-Instruct上从58.5%跌到只有3.5%,基本等于完全失去了做这类任务的能力。这印证了研究团队的核心论断:摘要会把不确定性彻底丢弃,而不确定性对于多阶段子目标任务的完成至关重要。

去掉状态追踪和状态正确性这两个由大模型作为裁判来评估的奖励信号,在两种基础模型上的影响有所差异:在Qwen2.5-3B-Instruct上只下降1.5个百分点,但在Qwen3-4B-Instruct上下降了18.5个百分点。这说明对于能力更强的基础模型,信念状态的质量约束对于充分发挥其潜力更加重要。

研究团队还测试了完全去掉任务特定督导(包括预热的有监督微调和特定领域的提示词)的情况。结果显示平均准确率从79.3%降到69.3%,有明显下降,但69.3%仍然高于大多数对比方法,说明纯靠强化学习训练本身就能提供足够的信号让模型学会结构化的世界状态追踪,有监督预热是有益的催化剂而非必要条件,这对方法在更广泛场景下的可应用性是个积极信号。

归根结底,这项研究做了一件在AI智能体领域颇具意义的事:把"我不确定"从一种需要回避的弱点,变成了一种可以被精确表达、主动利用的资产。Agent-BRACE 证明,一个懂得承认自己不知道什么的AI,比一个总是假装自己无所不知的AI,在真实的长期任务中表现更好、更稳健、也更高效。当信念状态模型用七个精细刻度的词汇表达"这件事我确认了""那件事我还不清楚"时,策略模型就能据此做出更有根据的行动选择,而不是在一个可能完全错误的世界图像上蒙眼前行。

这对AI在现实世界中执行复杂任务——无论是协助软件开发、网页导航、还是科学研究——都有直接的参考价值。未来随着研究的深入,如何让AI在更开放、更复杂的环境中自动发现和定义信念状态的维度,不再依赖人工预先设定,是研究团队明确指出的下一步方向。对这项研究感兴趣的读者,可以通过arXiv编号2605.11436找到完整的论文原文,其中包含所有实验细节、提示词模板和代码仓库链接。

Q&A

Q1:Agent-BRACE 中的 WEP 词汇表是什么?为什么需要七个级别而不是只用"确定"和"不确定"两级?

A:WEP 词汇表是一套表达不同把握程度的自然语言词汇,从 confirmed(确认)到 unknown(未知)共七个层级,就像温度计有多个刻度而不只是"热"和"冷"。实验证明,把七级压缩为两级会让 Qwen3-4B-Instruct 的平均准确率从 79.3% 跌到 65.3%,下降 14 个百分点,说明把握度的细粒度区分对实际决策有实质性影响,不是可有可无的装饰。

Q2:Agent-BRACE 的信念状态模型和策略模型为什么必须联合训练,能不能分开训练?

A:拆开训练效果会大幅下滑。实验中冻结信念状态模型只训练策略模型,Qwen3-4B-Instruct 的平均准确率从 79.3% 跌到 56.7%,下降超过 22 个百分点。原因是信念状态的生成质量需要通过与策略模型的协同优化来适配决策需求,信念状态必须"对决策真正有用",而不只是格式正确,这种有用性只能通过联合训练来传递。

Q3:Agent-BRACE 在 TextWorld 以外的任务上效果怎么样?

A:研究团队在 ALFWorld 家庭任务场景上做了测试,该场景涉及拿取、清洁、加热、放置等物品操作,与 TextWorld 的结构完全不同。Agent-BRACE(Qwen3-4B-Instruct)达到 30.7% 的准确率,比最强的强化学习基准 Direct-Action(RL)高出 2.85 个百分点,比记忆压缩方法 MEM1 高约 5 个百分点,说明结构化 WEP 信念表达具有跨任务的通用性。

文章标签微软合作智能体大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多