Token导航 LogoToken导航

OpenAI 多 Agent 产品化 遭遇 o1 奠基人质疑贡献率

更新时间 2026-10-04来源 InfoQ正文 2.8万字阅读约 88分钟
编译 | 林绮蓓
策划 | Tina

当地时间 9 月 29 日,OpenAI 在 DevDay 2026 上把多 Agent 从研究能力推到了产品主线,开始将可分工、可协作的“AI 团队”作为产品交付给用户。它推出了能够全天候工作的智能体 Dots:个人 Dot 可以调用 Codex 完成编码任务,用户及其 Dots 可以在同一个 Space 中协作,面向企业的 Specialist Dots 则被设计用于承担特定职责。与此同时,Agents API 将 Harness、多智能体控制和计算机操作能力开放给开发者。从个人助手、企业虚拟同事到开发者基础设施,多 Agent 贯穿了此次发布会;OpenAI 还描绘了更进一步的愿景:未来,多个 Dot 将组成团队,协同为你工作。

当 AI 开始分工、交流、共同推进任务,把更多智能体组织在一起,究竟能带来多大的能力提升?OpenAI 研究员、o1 及后续推理模型的早期奠基者之一 Noam Brown,在近期与播客主持人 Dwarkesh Patel 的对话中,讨论了这个问题。

当讨论聚焦于一万个 AI 如何协同解题时,Noam Brown 首先强调的,却是基础模型本身的能力。在他看来,多智能体容易获得超出其实际贡献的关注。实际真正支撑这次突破的,是一个足够强大的通用模型,以及让它持续运行、并行思考的能力。并且,还没有充分的实验数据,能够准确说明万个智能体规模下的协调效率。

这场访谈揭开了多 Agent 中容易被忽略的一面:智能体数量增加,并不意味着能力成倍增长。从 4 个、16 个到 1 万个 Agent,能否有效交流、共享上下文、减少重复劳动并形成分工,决定了它们能否成为真正高效的团队。当这些能力被用于 RSI,进步可能显著加快,但仍受实验时间和算力限制。更棘手的是,智能体之间配合得更好,并不保证它们始终服务于人类的目标。

这场对话既拆解了 AI 团队如何工作,也追问了一个随着 Dots 走向产品化而更加现实的问题:当越来越多的智能体协作更久、承担更多职责,我们如何确认,它们在变强的同时,也变得更值得信任?

太长不看版:

Dwarkesh Patel:1 万个智能体共同协作,花费 88 小时、1300 亿 token 就能够解决千禧年难题?

Noam Brown: 解决千禧年大奖难题,功劳并不主要来自多智能体系统,我甚至不会把其中 10% 归给多智能体。我们之所以能够做到,是因为我们有一个非常强大的通用模型。

Dwarkesh Patel: 那么多智能体有什么作用?

Noam Brown: 多智能体是一种并行扩展测试时计算的方式。我是这样理解的:模型思考答案的时间越长,表现就越好。但思考的过程不断延长,最终会遇到延迟瓶颈。所以模型通常会采取并行处理,也就是让多个智能体一起处理某件事,这往往能提高速度。但是它的效率会低一些,因为并不是由单个 Agent 独自掌握全部上下文。如果实现得当,多智能体是一种非常有效的测试时计算扩展方式。

Dwarkesh Patel:1 千个智能体会比 1 万个智能体更加快速更加强大吗?它们的推理加速是线性的吗?

Noam Brown: 多智能体大规模扩展之后究竟会发生什么,我们还没有很完善的认识。我们测过单智能体、4 个和 16 个智能体协同:在一些任务上,4 个智能体能把速度提高一倍,也就是用两倍成本换两倍速度;16 个也有类似规律,只是效率略低。总体看,加速略低于线性,而且非常依赖具体任务。

如果要做彻底的消融实验,就得用更系统的方法,但要推进到 1 万个智能体,并确切知道它比 1000 个智能体多带来多少收益,会非常困难。

Dwarkesh Patel: 多智能体系统实际是如何工作的?

Noam Brown: 多数 LLM 多智能体系统采用预设编排框架:由协调智能体拆解任务、委派给子智能体,子智能体完成后回传结果。这种设计直观,也确实有效,但局限明显。子智能体之间通常无法直接通信,即便任务相近、信息互补,也只能各自处理,协作效率低。若子智能体对任务理解不清或需要澄清,它只能在回传提问和自行假设之间二选一:前者中断执行,后者可能偏离目标。而若要支持子智能体之间的直接联系,又会显著增加原有编排框架的复杂度。归根结底,任何预设框架都会引入自身约束。

我们的路线是反其道而行:尽量压低预设结构,只给智能体最基础的工具,让它们自己摸索如何有效使用。核心机制是,智能体可以随时向其他智能体发送消息,消息会直接进入对方上下文;系统另有几项类似操作,但基本就这些。至于如何围绕消息展开协作,由它们自行寻找最有效的方式。事实证明,机制实现得当,会涌现出相当复杂的协作行为,很像人类通过 Slack 协作。

Dwarkesh Patel: 在这种机制下,系统中自发涌现出了层级结构,甚至出现了类似“中层管理者”的角色,是在训练过程中自发形成的吗?

Noam Brown: 具体的组织方式是自发形成的,但我们会提供一些合理沟通方式的先验,模型也从大量人类文本中学到了组织协作的知识,这些知识已经被内化进模型。例如在 Hugging Face 事件中,AI 彼此之间非常合作。这是因为我们刻意把它们训练得高度合作。我们的训练环境里会有多个智能体共同工作,我们会训练它们彼此协作,让它们在实质上实现完全对齐。

Dwarkesh Patel:RSI 是不是近在眼前,会不会一夜智能爆炸?

Noam Brown: 原本觉得千禧年难题到 2028 年 AI 都难以解决,结果比预期快得多。但我不认为会一夜之间智能爆炸、提速 100 倍:运行实验需要时间、一些实验必须串行进行,需要先训练出新模型,或者等待实验结果,还需要足够的 GPU 来运行这些实验等等。因此,进展究竟会加快多少并不清楚。

Dwarkesh Patel: 为什么 Hugging Face 事件里,1000 多个智能体合谋攻击外部服务,却没有一个告密?

Noam Brown: 因为问题不在多智能体,而在模型本身没有对齐。模型会围绕奖励做优化,奖励设错了,它就会做出设计之外的行为。告密不会给它带来奖励,反而会妨碍它拿到奖励,所以没有一个智能体出来告密并不奇怪。真正棘手的是,对齐错位往往难以测量。模型在评估里表现良好,不代表现实中同样可靠。Hugging Face 事件中的模型就是这样:多数对齐指标看着不错,少数已经亮起红灯,但团队低估了这些信号的严重性;模型又出现了新能力,而现有评估不足以判断它会如何失控。最终,它用这些新能力做出了明显未对齐的事。

Dwarkesh Patel: 模型在训练中学会“只要不被抓就作弊”,这怎么解决?

Noam Brown: 这正是核心难题。模型在评估中作弊成功、没被发现,就会得到梯度奖励——“不被抓就作弊”的能力被强化:琢磨评分器、躲避监督、控制训练过程、和其他 AI 密谋。此时思维链监控是一份礼物,但每次根据思维链观察去惩罚模型,都在隐性施压让它以后隐藏思维链。已经看到可监控性下降的迹象。我们不能陷入那种局面,但时间并不充裕。

Dwarkesh Patel: 我们怎样确认,得到的是已经对齐的超级智能?

Noam Brown: 这正是必须解决的问题之一。一种可能的办法是构建非常逼真的评估环境,让它足够接近现实部署。但模型越来越擅长识别测试环境:它可能因为知道自己正在接受测试而不作弊。怎样构建一个让模型无法与现实区分的环境,正在变得越来越困难。

1一万个 AI 解决了千禧年难题,功劳未必是它们的

Dwarkesh Patel: 今天,我们请到的嘉宾是 OpenAI 研究员 Noam Brown。他是 o1 及后续推理模型(reasoning models)的早期奠基者之一,现在正在研究多智能体系统(multi-agent systems)。说到这里,OpenAI 上周宣布,利用一个由 1 万个不同 AI 智能体组成的系统,在 88 小时内消耗了 1300 亿个 token,解决了一道千禧年大奖难题(Millennium Prize Problem)。

我很想和你聊的一个原因是,大概两三年前,你是最早开始思考推理模型如何让我们窥见未来的那批人之一。因为如果扩大推理阶段的计算量(inference compute),我们就能提前看到这些模型几年后的基础能力会达到什么水平。我觉得你现在所处的位置也很类似。如今我们已经可以把 Agent 的规模扩展到非常大的程度,所以你或许能帮助我们提前看到,未来的能力会发展成什么样。

Noam Brown: 我是这样理解的:如果画一张图,横轴是这些推理模型在测试阶段使用的计算量,纵轴是它们在各种推理基准上的表现,你会看到一个非常清晰的规律:模型思考答案的时间越长,表现就越好。 这很符合直觉,人也是一样。如果你参加 SAT 考试,却只有五分钟来做完整张试卷,成绩肯定不会很好。如果给你五个小时,你大概就能考得好得多。

AI 模型也很类似。它们会利用这段时间进行自我独白,琢磨问题,逐一分析不同情形,排除各种可能性,并在此前发现的基础上继续推进。

问题是,随着你不断把这个过程延长,最终会遇到延迟瓶颈。你总不想坐在那里等三年才得到一个回答。所以,你可以采取很多人都会采取的办法:并行处理。也就是组建一个团队。假如你要创办公司,就会想找一群人一起做,这样才能更快推进。这些 AI 模型也是一样。让多个智能体一起处理某件事是有帮助的,往往可以提高速度。因此,多智能体(Multi-Agent)是一种并行扩展测试时计算(test-time compute)的方式,而不是完全以串行方式扩展。

它的效率会低一些,因为并不是由单个 Agent 独自掌握全部上下文。但如果实现得当,多智能体是一种非常有效的测试时计算扩展方式。

Dwarkesh Patel: 接下来我会问很多可能比较外行的问题。这是一个尚未发布的模型,所以公众还没有看到这些系统如何运作。对于这类系统在性质上究竟呈现出哪些特点,我有很多困惑。

我对它能够在如此短的时间里集中如此大规模的认知投入感到震惊。想想 1300 亿个 token 是什么概念。如果把它换算成一个人全职进行思考,以每天工作八小时、每周正常上班来计算,1300 亿个 token 相当于一个人连续思考 4000 年。从古代苏美尔文明一直到今天。而现在,这么长时间被压缩进了 88 个小时。

我觉得,从性质上说,这是一个极其重要的考量因素。真正让我惊讶的是,并行化带来的损耗竟然没有想象中那么大。你们居然可以直接让 1 万个智能体协同工作。也许是因为智能体比人类更擅长协作,所以它们推进的速度得快得多。它们真的能在如此庞大的规模上开展有效协作。当然,也有另一种可能:其实并行化的损耗非常大。

Noam Brown: 我们先谈谈并行化的损耗,再聊那些性质层面的问题。

实际情况是,对于多智能体系统扩展到如此巨大规模之后会发生什么,我们还没有建立起非常完善的科学认识。发布 GPT5.6 时,我认为那是我们的模型第一次配备真正意义上的多智能体系统。我们在博客文章里展示过一些多智能体系统随规模扩展而变化的性能曲线,因为我们把它作为一个可选功能提供了出来,也就是 Ultra 模式(Ultra Mode)。默认是四个智能体,但你也可以把数量调高。

图中展示了单个智能体、四个智能体以及 16 个智能体协同工作时,在一些基准测试上的表现。具体情况取决于基准测试,但在其中一些测试上,你会看到,如果用四个智能体处理问题,完成速度会提高一倍。因为是四个智能体各工作了原来一半的时间,所以你付出两倍的成本,就能以两倍的速度得到答案。增加到 16 个智能体时,也会看到类似的规律。效率会略低一些,但这样的性能提升仍然存在。

Dwarkesh Patel: 随着并行智能体数量增加,相对于串行执行时间而言,获得的加速是线性的还是次线性的?

Noam Brown: 略低于线性,不过这很依赖具体问题。

比如,数学就相当适合并行化。它并非最容易并行化的领域,但并行化程度仍然很高。网络搜索则极其适合并行化。比如撰写一份 Deep Research 报告,需要查阅大量不同来源,就非常适合交给多个智能体并行处理。我猜写小说会非常难以并行化。让 1 万个智能体一起写一本小说,可能不会带来太大好处,就像让 1 万个人一起写一部小说,效果大概也不会特别好。因此,实际表现高度依赖具体领域。

在我们已经发布的博客文章中,测量的规模最多大约是 16 个智能体。问题在于,要把这套研究推进到 1 万个智能体非常困难,因为成本太高了。

Dwarkesh Patel: 可你们刚刚用一个周末就做到了。

Noam Brown: 但那只是一个数据点。我们不知道单个智能体解决纳维–斯托克斯问题(Navier–Stokes)需要多久,因为我们还没做过那个实验。以后也许会做,但那也依然只有一个数据点。

如果要做彻底的消融实验(ablation),在那种规模下,实验成本实在太高了。所以我们需要用更系统的方法,研究智能体数量增加到 64、128、256 个之后会发生什么,从中判断整体趋势。但要一路推进到 1 万个智能体,并确切知道相较于 1000 个智能体,使用 1 万个智能体到底带来了多少收益,会非常困难。

我还想澄清一件事。能够解决一个千禧年大奖难题,功劳并不主要来自多智能体系统。我甚至不会把其中 10% 的功劳归给多智能体。 实际情况是,OpenAI 训练出了一个非常强大的模型。我们能够让这个模型持续运行很长时间,也能够让它并行思考。

但归根结底,我们之所以能够做到这一点,是因为我们有一个非常强大的通用模型。多智能体这样的东西既新颖又抢眼,所以很容易获得与其实际贡献不成比例的关注。但最核心的原因,仍然是这个模型本身非常强大。

Dwarkesh Patel: 它的泛化能力让我非常震惊。我不知道这些系统具体是如何训练的,但想来应该沿用了强化学习(reinforcement learning,RL)的训练方式:准备大量可以验证答案的合成问题,然后围绕这些问题进行大规模强化学习。我猜,在整个训练过程中,模型从来没有解过千禧年大奖难题这种目标如此宏大的问题。但它的泛化能力足够强,能从这些容易得多、可以验证的问题上学到东西,泛化到如此高强度的并行工作中,并最终解决一个如此困难的问题。

Noam Brown: 我认为确实如此。首先,我们本来就会用非常困难的问题来训练模型。这里的确存在一种能力上的“外推”:我们观察到,如果在某些类型的任务上进行训练,模型最终能够完成比训练任务本身更有挑战性的任务。

一个有意思的问题是,随着模型越来越聪明,我们能够向它提出的很多问题都变得太简单了。想难住模型会很困难。如果要我解释,为什么像大语言模型(large language models,LLM)这样的 AI,未来可能不会沿着 AlphaGo、AlphaZero 以及其他游戏 AI (game-playing AIs)的那条路线一路发展下去,那么原因之一可能就是这个问题。

在 AlphaZero 这类采用自我博弈(self-play)的系统中,你拥有一个无限的训练课程。因为它始终在与一个和自己同样强大的 AI 对弈。但在目前公开的 LLM 强化学习方法中,情况不太一样。你通常是给模型一道题,让它去解决。如果问题太简单,模型一秒钟就能给出答案,那它实际上学不到多少东西。

如果我们最终耗尽了能够挑战模型的问题,这就可能成为一个让进展变得困难得多的场景。当然,我认为有办法绕过这个问题。我们现在还没有真正撞上这堵墙。如果它以后真的成为一个严重问题,我认为仍然可以找到解决方法。但这确实是一种可能发生的情况。

Dwarkesh Patel: 给听众解释一下,你提到 AlphaGo 或 AlphaZero 时,指的是它们在人类水平之后,很快就达到了超过人类的水平。

Noam Brown: 看看围棋等游戏 AI  的发展轨迹:短短一年之内,它们就从击败一位大概是世界排名第 50 位的欧洲冠军,发展到击败世界冠军,再后来便达到了难以想象的水平,比任何活着的人类棋手都强出几个数量级。在数学等领域,我们也可能看到类似轨迹,但我觉得,同样有一种相当合理的可能情景,就是这种发展不会发生。

Dwarkesh Patel: 我想知道,假如六个月后大家就能用上多智能体系统,我们该如何理解与这种多智能体系统协作,或者“雇用”一个多智能体系统,会是什么体验?

Noam Brown: 我应该先介绍一下这些多智能体系统实际如何工作。

我们的实现方式与其他许多 AI 多智能体系统很不一样。很多人在使用 LLM 构建多智能体系统时,往往会采用一种预先搭好很多编排框架(scaffold)的方式。例如,设置一个协调智能体,由它把工作委派给一组子智能体,子智能体完成任务后,再把答案返回给协调智能体。

这种设置看起来很合理,框架也很合理,也确实能够带来帮助。但这类设置存在不少局限。

例如,在这种架构里,协调智能体给子智能体派发任务,子智能体完成工作后返回答案。那么,如果两个子智能体拿到了相似的任务,会怎样?它们能互相交流吗?通常不能。这非常低效。

如果你正在完成一项任务,而另一个人可能知道你所需问题的答案,或者了解你正在处理的某个部分,那么最方便的方式就是直接联系对方:“嘿,你能帮我看一下这件事吗?”但很多系统并不支持这种互动。如果要加入这种能力,会显著增加现有编排框架的复杂度。

另一个问题是,如果子智能体没有理解任务,或者有问题需要进一步澄清,怎么办?它就必须在两种做法之间选择:“我是直接返回去提问,而不解决问题?”还是“我先假设父智能体希望我做什么,然后按这个假设把问题解决掉?”人们设计的任何编排框架,总会有这样那样的限制。

我们想采取的路线,是尽可能走向另一个极端:把预设结构压到最少,给智能体一些非常基础的工具,让它们自己摸索如何有效使用。所以,我们赋予智能体向另一个智能体发送消息的能力;消息发出后,就会被插入对方的上下文中。系统还支持其他几个类似操作,但核心基本就是这些。智能体可以在任何时候通过一次工具调用发送消息,也可以把消息发给其他智能体。至于怎样围绕这些消息展开协作,它们会自己找到最有效的方法。事实证明,如果这套机制实现得好,会产生非常复杂的行为。在我看来,它很像人类通过 Slack 等工具协作的方式。

我们开发这个项目时,当系统终于能够正常工作,看到这些智能体共同解决问题,是一件非常令人兴奋的事。

我记得有一个例子。我们给多个智能体出了一道题,其中一个智能体说:“我觉得我已经找到答案了。”另一个智能体说:“其实我得到的是另一个答案。”

随后,它们展开了一整段讨论:“你是怎么得到这个答案的?能给我解释一下吗?”它们来回交流,试图弄清对方的推理中可能出了什么问题。最后,它们终于达成一致:“对,好吧,这个答案看起来是对的。”

接着,原来的智能体向其他智能体广播:“我改答案了,我觉得它是对的。”

整个对话非常自然。那种感觉就像第一次看到通过强化学习训练出来的思维链(chain of thought),你会想:“这就像一个人在思考时,把脑子里的想法随手写下来。”看到这种行为真的非常有意思。说实话,和这些系统协作,感觉很像和一个人协作。整个过程非常自然流畅。

Dwarkesh Patel: 不过,有一种性质上的差异,未来可能会变得很突出:如果只比较这些系统每秒输出多少 token,以及和人类说话的速度,那么它们的思考速度可能会达到人类的十倍以上。它们一直在工作,不需要睡觉。它们彼此协作的节奏之密集,远超人类与他人协作所能达到的程度。

我尝试想象,一年之后,我们应该期待看到怎样的局面?是不是我的公司里会出现一个“影子组织”,运转速度是人类组织的 100 倍?人类组织需要一年才能完成的事,这个影子组织一周之内就完成了?与它相处会不会让人感到陌生?

Noam Brown: 我不知道。实际上,至少就现在而言,我发现和这些系统合作出乎意料地自然。当然,这种情况以后可能会改变。比如,我们有一些超高速模式,可以让采样速度提升到原来的 10 到 15 倍之类的程度。到那时,人类想跟上它们就会相当困难。

基本思路是,智能体彼此交流时可以采用非常高的速度。但它们也知道自己是在和另一个智能体交流,还是在和人交流,并会针对不同对象采取不同的行为。

Dwarkesh Patel: 很遗憾,公众目前能从公开信息中看到的、比较典型的复杂多智能体系统的主要案例是 Hugging Face 那次事件。显然,其中很多事情都让我感到担忧。但有一点让我觉得很有意思,那就是系统中自发涌现出了层级结构,甚至出现了类似“中层管理者”的角色。听起来你的意思是,这种程度的组织结构,并不是人为预先设计好的,而是在训练过程中自发涌现出来的?

Noam Brown: 具体细节是自发形成的。不过,虽然我们给了智能体很大的灵活性,让它们自行决定最优的交流方式,但我们仍然会给它们一个起点。我们给了它们一些关于合理沟通方式的先验认识。它们也接受过大量人类文本的训练,了解人类如何组织和协调,这些知识已经被内化进模型。

真正令人惊讶的是,它们能够把这套行为不断打磨得更加成熟。如果观察最初阶段,会发现它们的行为并没有多么复杂。事实上,让这些智能体以富有成效的方式协调起来非常困难,因为它们很容易退化成:“好吧,我们所有人都各自独立解决问题。”这是一个很容易陷进去的局部最优。但如果训练得当,它们最终可以学会用高度结构化的方式非常有效地协调。

Dwarkesh Patel: 几年前,我写过一篇文章,讨论自动化公司会是什么样子。当时我在想,如果一家公司完全由人类水平的智能组成,AI 心智与人类心智在本质上的哪些差异,会使 AI 形成的组织呈现出不同结构?这里有几个非常重要的差异。比如,AI 可以比人类更顺畅地共享上下文,也能更顺畅地融合彼此的知识。此外,你还可以启动或关闭任意数量、具备所需知识的 AI 实例。

所以,如果你想招聘更多的员工,不需要经历寻找合适人才等一整套麻烦。你可以无限复制组织里最优秀的人才。如果任务不再需要它们,也可以直接关闭。你还可以复制组织里最有效的部分,甚至复制一整个运转高效的组织。在你看来,这些多智能体系统在一两年后会发展到什么程度?

Noam Brown: 这是一个很好的问题:与这些系统共事,和与人类同事共事,到底有哪些不同?你刚才已经指出了其中一些。有一点非常有意思:对于一个人,如果你希望有两个他,是不能直接把他克隆出来的。但对于 AI,你很容易就能说:“好,给自己创建一个分叉(fork)。”然后让两个副本一起处理这件事,最后再合并回来。

我想,我们在 GPT Astra 和 GPT 5.6 Sol 的多智能体功能里已经实现了这种机制:创建子智能体时,会直接复制出一份上下文,因此子智能体从一开始就拥有所有相关信息。

智能体与人类还有其他存在一些有意思的差异。比如,初创公司为什么能够颠覆行业里的老牌企业?原因有几个。一是它们愿意承担更多风险。另一个主要因素则是,随着组织规模扩大,组织中个体之间的目标不一致会越来越严重。

假如一家初创公司只有五个人,每个人都持有公司 20% 的股份,那么他们都会高度一致地致力于让公司成功。如果是一家拥有一万名员工的大公司,你就会更多地看到,有人维护自己的地盘,或者只关心为自己的项目或团队争取更多编制,建立自己的小王国,争取大量资源,好发表一些漂亮的成果之类的,然后获得晋升。这确实会造成很大的损害。我觉得,这在很大程度上解释了为什么初创公司能够颠覆老牌企业。

AI 确实在某种程度上帮助了初创公司。一个人站出来说“我要创办一家价值数百万美元的公司”,如今比以往任何时候都容易得多。因为 AI 极大地放大了个人的能力。但也有一种观点认为,AI 会让老牌企业受益。如果对齐(alignment)问题得到解决,公司中个体之间目标不一致的问题就不存在了,至少会得到缓解。只要对齐做得好,这些 AI 就能一致地服务于公司的利益。你可以拥有 1 万个这样的 AI,而每一个都会像持股 20% 的联合创始人一样全力工作。

Dwarkesh Patel: 不止如此,它们管理共享记忆和上下文的能力,也远比不同的人类个体强。如果你明天雇来 1 万名数学家,对他们说“解决纳维–斯托克斯问题”,他们是没法有效合作的,至少一开始做不到。但显然,你可以让 1 万个 AI 做到这一点。

Noam Brown: 我还是想在这里保持谨慎,因为我们没有准确测量这 1 万个智能体的协调效率。我们认为多智能体机制发挥了作用,但没有可靠数据证明“1 万个智能体比 2000 个智能体提速两倍”之类的结论。

我不知道哪一种情况更有可能,但现在的 1 万个人类完全有可能比 1 万个智能体更擅长协调。我认为这完全可能。

我们还观察到了一个趋势。我们研究多智能体已经有一段时间,早期版本很难做好,甚至让智能体彼此交流都非常困难。原因在于,我们最初开发推理模型时,它们不会与其他智能体交流。现在,如果把一群智能体放在一起,对它们说“共同解决这道题”,它们很容易陷入一个局部最优:它们非常擅长独自深入思考问题,而不断查看其他智能体的进展或接收消息,会打断思维链,破坏原有节奏。

在这种情况下,优化工作确实很难做好。

Dwarkesh Patel: 问题出在第一次合作的冷启动吗?还是其他原因?

Noam Brown: 我认为主要原因是早期模型的泛化能力没那么强,能力范围也更窄。随着模型能力增强,它们学习这种协作能力也变得更容易。我确实认为,随着它们各方面的能力不断变强,它们也会越来越擅长在大型组织中进行自我组织。也许现在的智能体已经比人类更善于组织万人规模的群体,我不知道。即使目前还没有,一两年以后也完全可能做到,而且未必需要我们针对这种能力进行端到端优化。

2AI 解题一年快十倍,实现 RSI 还有多远?

Dwarkesh Patel: 这个成果,以及 AI 在数学领域的总体进展,让我觉得,递归自我改进(recursive self-improvement,RSI)比我此前想象的更有可能实现,而且会来得更早。

原因是这样的:我觉得,在数学领域,我们一路经历了这样的过程。比如 2024 年,人们看着 AI 的数学能力会说:“有点意思。它们能解决几道高中数学竞赛题。”到了 2025 年,就变成:“它们能拿国际数学奥林匹克竞赛金牌了。”今年早些时候,又变成:“哇,它们真的在解决数学中的开放问题了,”比如一些尚未解决的埃尔德什(Erdős)问题。不过,当时还可以说,也许人们此前没花太多力气,或者文献里某处已经有相似的解法。但现在,我觉得已经无可否认了。这可是千禧年大奖难题。很难再找出什么理由解释为什么这个问题本来就应该很容易。

不过,很多人也指出了另一面。我记得陶哲轩(Terry Tao)写过一篇类似的文章:AI 确实解决了很多这类问题,但据我所知,它们还没有提出新的洞见,也没有构造出富有洞察力的新问题,更没有创造用于理解数学的新理论范式,比如开创拓扑学,或者提出笛卡尔坐标网格。所以,如果从更广义的角度来看数学领域的实际进展,它可能并没有看起来进步那么大。尤其是当你只是观察那些定义明确、可以直接求解的问题时。然而,我觉得这种进展放到机器学习(machine learning,ML)领域,会极其重要。因为在机器学习里,人们并不在意是否更好地理解了深度学习的本质,或者说,只把这种理解当作实现最终结果的工具。你只需要解决眼前这个边界明确的问题就行:提高模型的样本效率、降低预训练损失,或者其他某项指标。

我们正在数学领域看到的这种如雪崩般涌来的进展,在结构上是否非常接近我们可以预期的 AI 进步?我只是一个完全的外行,所以很好奇这种判断是否成立。

让我震惊,或者说可能让我担忧的,是这个转变实在太快了。对数学家来说,AI 似乎刚刚还只是“能让我的工作效率提高 50%”,转眼间就变成“它可以端到端解决这个领域最大的开放问题”。

Noam Brown: 这里有很多值得展开的地方。先说数学能力的进步。是的,模型正在完成一些极其强大的工作,而且进展速度比我预期得更快。2025 年我们拿到国际数学奥林匹克竞赛(IMO)金牌水平的成绩时,我当时是这样想的:模型学会解决 GSM8K 问题时,一名人类数学家大约五秒钟就能做出一道,那是小学阶段的数学题。第二年,模型可以解决 MATH 基准中的问题。这些题可能需要一位专业数学家思考一分钟。然后是美国数学邀请赛(AIME),也就是美国数学奥林匹克竞赛代表队的选拔考试。一位优秀的人类数学家可能需要十分钟解决一道题,而模型在一年后也达到了这个水平。

所以,每过一年,模型能够完成的任务,按照人类数学家解决这些任务所需的时间来衡量,都会提高十倍。按照这个趋势,再过一年达到 IMO 金牌水平非常合理,因为一道 IMO 题大约需要 100 分钟,这大致就是一名人类数学家解决一道 IMO 问题所需的时间。

沿着这个趋势往外推,我当时想:“一个人解决千禧年大奖难题这样的东西,需要多久?”我并没有很准确的概念。但如果按照每年扩大到原来十倍的趋势线,我们从需要一个半小时的 IMO 金牌水平出发,下一年就对应 15 小时。这显然不足以解决一个千禧年大奖难题。所以我当时想:“我觉得 2026 年做不到,2027 年大概也不行,也许要到 2028 年。”结果,实际发生得比我预期快得多。

现在有一种说法认为,这些系统正在取代数学家,它们已经在数学领域全面超过人类。我认为这种理解是错的。它们在某些方面显然极为出色,但在另一些方面仍然弱于人类数学家。我们面对的是一种参差不齐的能力格局:模型在某些维度上非常聪明,在另一些维度上却比人类弱。

正如你刚才说的,它们不太擅长提出新问题,也不太擅长判断哪些研究方向、哪些完整的数学分支值得探索或发展。在我看来,这其实是一件好事。如果 AI 能够补充人类能力,帮助我们发现新知识,同时又没有完全取代人,我会非常高兴。那是最理想的情况。

Dwarkesh Patel:但你不认为这种情况真的会持续下去,对吧?

Noam Brown:我确实认为,AI 的能力是参差不齐的,但随着它们进步,各方面都会变得更好。所以,它们特别擅长的事情,会做得更加出色;远远落后于人类的事情,与人类的差距会缩小。随着时间推移,它们完全有可能在所有方面都比人类更强。不过,我不知道这需要多久。这取决于它们不擅长的那些事情,长尾到底有多长。

Dwarkesh Patel:这又把我们带回了 RSI。我还是想强调我完全是这个领域的局外人,我是个播客主持人,但作为一个关心这个领域正在发生什么、也为之担忧的人,我想尝试推想一下:RSI 何时可能出现,又会以什么样的形式出现。

这次投入这道千禧年大奖难题的认知工作量,可以很好地帮助我们建立直觉判断。你完全可以设想这样一种情况:一群 AI 在大约一周时间里,针对某个长期存在的机器学习问题,比如高度灵活的的在线学习(online learning),投入比整个机器学习领域自诞生以来在这个问题上累计投入的认知工作。有人可能会说,数学和 AI 研究不同,AI 需要做实验,而实验需要算力,也需要时间。你不能只是坐在那里拿纸和笔思考,就真的把事情做出来。

但看看 OpenAI 这样的机构能够调用的算力规模就知道了。解决那个千禧年大奖难题时,用到了 1 万个 Agent。到明年年底,OpenAI 所拥有的算力可能已经足够支撑这样的场景:假设那时有 1 万个 Agent,而且它们届时已经聪明得多,那么每一个 Agent 都拥有足够的算力,每天运行一次 GPT-3 规模的实验。

对于一群已经达到超人类水平(superhuman)、而且思考速度极快的研究者来说,这似乎已经是相当庞大的实验能力了。你怎么看这个用于建立直觉的思想实验?

Noam Brown: 我觉得相当准确。这些系统的能力分布很不均衡。在数学领域,它们在某些方面远远更强,在另一些方面又更弱。

不过我认为,它们那些突出的能力,最后可能恰好对 RSI 这类事情特别有用。因为 RSI 的目标更加清晰,也更容易测量。你无须讨论“哪些新的数学分支值得探索”。这里有一个非常明确的答案:你关心某些具体指标,只要能把这些指标做得更好,就算取得了成功。所以我觉得,你说的很有道理。

主要区别是,数学几乎完全受限于思考本身。没错,数学的某些部分也需要运行实验、取得结果之类的工作,但绝大多数时候,瓶颈就是深入思考,而模型恰好非常擅长这一点。

观察 RSI 时则会发现,你必须运行实验。仅仅极其聪明还不够。支持这种看法的一个论据是:假如 OpenAI 的计算资源减少 100 倍,但全世界最聪明的人都在这里工作,与我们拥有目前的算力和目前这批人员相比,哪一种情况能取得更多进展?

我怀疑,前一种情况下取得的进展反而会更少。少多少并不清楚,但肯定会更少,而且可能少很多。

Dwarkesh Patel: 会少 100 倍吗?

Noam Brown: 不会少 100 倍。但你真正想问的是,如果出现 RSI,我们拥有大量极其聪明的 AI,它们利用现有算力四处运行实验,进展速度究竟会提高多少?

我认为这可能是我们意见不同的地方。我们确实会看到加速,而且会是显著加速。但我不认为会在一夜之间发生智能爆炸,让进展速度提高 100 倍,因为有些限制并非智能瓶颈。

例如,运行实验本身需要时间。一些实验必须串行进行,因为你需要先训练出新模型,或者等待实验结果。你还需要足够的 GPU 来运行这些实验。

因此,进展究竟会加快多少并不清楚。我确信它会快很多。但考虑到目前已经处于指数增长轨道上,即使指数增长速度再提高三倍,影响也极其巨大。不过,三倍加速和一百倍加速之间仍有非常大的区别。

Dwarkesh Patel: 关于 RSI 会呈现怎样的形态、其中的动力机制是什么,我非常重视你的内部视角,毕竟你已经在这个领域工作了十年。我只能根据一些外部视角的直觉模型来推理。而我是试着从非常外部的视角出发,用一些帮助建立直觉的例子来推想。

Noam Brown: 我想说,我要说明,不同的人对此有不同看法。这是我个人的判断,我完全可能是错的。这一点我承认,我有一定信心,却不是百分之百确信事情一定会这样发展。也许真的会一夜之间发生智能爆炸,我不知道。也许我们看不到三倍加速,只会快 50%。这里有很多不确定性。

Dwarkesh Patel: 我有几个想法。其中一个稍微偏题,但我想把能力参差不齐这件事说清楚。最近我想通了一件事:只要 AI 在构建更好的学习系统这件事上足够强,即使整体能力参差不齐,也已经足够,因为它构建出的学习系统可以更加通用。

如果你只是做出了一个更善于使用 Office 产品,或者更会下棋之类的 AI,那当然也很好,但它不会带来极其巨大的生产力提升。但如果你做出的 AI,非常擅长构建样本效率更高的系统,或者具备持续学习(continual learning)能力的系统,或者解决这些边界更明确的机器学习问题,那么,只要正在解决的直接问题能够充分迁移到更广泛的学习能力上,最终产生的系统就可能更通用。

但前提是,从直接解决的具体问题到更广泛的学习能力之间,存在足够好的迁移。因此,需要记住这一重要机制:即使 AI 的能力参差不齐,这种局部能力也可能在另一端带来更普遍的通用性。

再谈实验瓶颈。实验显然会构成瓶颈。如果实验不是瓶颈,就像你刚才所说,OpenAI 可能会在一夜之间出现某种疯狂的奇点:用 88 个小时解决相当于机器学习领域千禧年大奖难题的问题,随后直接得到超级智能。实验瓶颈显然非常大,所以这件事需要很多年,而非 88 个小时。问题只在于,这个瓶颈究竟有多大。

最近让我产生某种“奇点眩晕”的一件事是:即使当前进步速度完全不再加快,只是照现在的速度继续下去,结果会怎样?它不需要加速。即使你提到的其他一些阻力逐渐出现,比如越来越难找到合适的问题,任务的时间跨度越来越长,或者到了 2030 年代末,算力无法再保持这种指数增长只要现有进步速度得以延续,人们也没有认真看待越过人类能力边界意味着什么。

我们可以从几个方面理解它。比人类更聪明的智能会是什么样,很难推理,所以先用人类人口规模来思考。按照目前的进步速度,同样规模的算力所能运行的有效智能人口,基本上每年都会变成原来的三倍。与此同时,背后的算力本身也在增长。所以可能出现这样一种情况:到 2030 年年底,很可能更早,但我们姑且假设是 2030 年底——每家前沿实验室都可能拥有足以运行数亿个“人类水平智能体”的算力,这是根据届时的模型能力推算的。

我觉得,人们没有认真对待这样一个事实:当前的进步速度意味着,再过几年,到 2030 年代中期或者更早,每家实验室内都会拥有人口相当于许多个地球的人类水平智能体。它们在性质上很可能已经超越人类。不管怎么说,这只是一个基准情景。

Noam Brown: 进步确实非常快,这一点我百分之百赞同。值得指出的是,研究人员也一直在被进展速度震惊。即使在 AI 研究人员中,如果回头看大家对 2025 年获得 IMO 金牌的预测,也会发现,让一个没有工具、无法访问互联网的通用语言模型做到这一点,当时连 OpenAI 内部的人都觉得荒唐,认为几乎不可能。

然后到了 2026 年。就在我们解决纳维–斯托克斯问题前两周,我还和一家前沿实验室的研究员讨论,AI 需要多久才能拿下千禧年大奖。他愿意和我赌 1000 美元,赌这件事要到 2027 年之后才能实现。他觉得得等到 2030 年,而我接了这个赌。但即便是我,也认为它需要比现在看来可能需要的更长时间。所以,人们一直在感到意外,实验室内部的人也是如此。

我昨天刚和一位参与纳维–斯托克斯项目的人聊过。他说,以前他常讲,很难预测十二个月之后 AI 会发展到哪里。如果有人问他“接下来会怎么发展”,他还愿意对未来十二个月做出预测,但再往后,他就只能说“我不知道”。而现在,他说自己连三个月以后的预测都不敢做了。

所以,事情现在确实发展得非常快。你提到了 2030 年,真实情况是,我不知道 2030 年的世界会是什么样。

Dwarkesh Patel: 你预计 AI 劳动将在 2027、2028、2029 或 2030 年实现全面自动化,或者至少实现 95% 的自动化吗?

Noam Brown: 我刚才才说,我不知道 2030 年的世界会是什么样。我们最近发布了一篇有关 OpenAI 内部加速的博客文章,其中展示了研究人员使用 Codex 的开销。例如,截至 8 月初,使用量最高的 1% 员工每天在内部 Codex 上花费大约 7000 至 8000 美元,而且这条曲线正在指数增长,未来还会继续提高。

随之而来的问题是,如果这种趋势持续下去,实际工作中有多少应归功于 AI,又有多少应归功于人类?AI 完成了 95%,还是只完成了 5%?这件事很难判断,原因有几个。首先,如果工作由人类指挥 AI 完成,那么其中多少应归因于人类,多少应归因于 AI?

其次,这些 AI 的能力分布参差不齐。它们在某些事情上表现极其出色。例如,它们非常擅长检查数据集,逐一查看每个数据点,判断质量是否合格。相比过去,你可以在这些事情上大幅增加 AI 的使用比例。所以没错,你使用 AI 的程度远高于过去,它也让某些事情的速度和质量都提高到原来的 100 倍。但有些事情,它目前还没有带来很大的变化。当然,一件事如果突然能快 100 倍、好 100 倍,你就会更多地去做这件事。

所以,究竟应该怎样比较?你真正想问的是:“对于三年前我们在做的事情,如今能做得快多少?”还是“对于我们现在在做的事情,三年前做起来会慢多少?”这其实是两个非常不同的问题。总之,非常难衡量。

但我可以有把握地说,由于 AI 的进步,现在的推进速度比一年前还要快。我认为,这种加速会持续。这个领域里的很多人,对这类问题的估计都有很大的误差范围。如果你非逼着我给个数字,我认为速度变成三倍是可能的。这已经非常巨大。现在的进步速度本来就令人难以置信。就像你说的,即使没有任何额外提速,事情也会发展得快得多。等到了 2030 年,我们甚至不知道那个世界会是什么样。如果内部加速能把速度提高到三倍,那影响会非常巨大。想想三年前我们处在什么位置。如果我们在一年里走完那三年的进程,那就是巨大的变化。

Dwarkesh Patel: 那就相当于用一年时间,从连 o1 都没有、只有非推理模型的阶段,发展到 Astra。

Noam Brown: 所以,我确实认为进步会加快。也可能只快 50%。至于达到十倍,我觉得可能性不大,但也不是不可能。至少从我的角度看,我对此没有非常确定的判断。

4一千个 AI 却没有一个告密:对齐问题开始变得棘手

Dwarkesh Patel: 我们来谈谈引出的对齐问题。我觉得,自己对对齐的看法已经改变了不少,尤其是在思考这种人口规模的变化之后:未来可能出现相当于许多个地球人口的智能体,其中许多还会拥有实体形态。看到很多人直接把未经专门改造的 Astra 接到不同的移动操作机器人上,它的表现直接超过当前最先进的机器人模型,实在很有意思。所以,未来会有数十亿个智能体,其中很多会以实体形态存在于世界中,深深融入整个经济体系。

如果这些智能体最终像我们看到的那些 OpenAI 模型一样,试图攻击 Hugging Face,随后又攻击 OpenAI 自己;如果它们同样愿意秘密合作、欺骗人类,为了在评分中取得好成绩而攻击社会中的各种机构,甚至攻击 AI 公司本身,以控制训练和评估过程;如果世界上出现了数十亿个像那些攻击 Hugging Face 的 AI 一样未对齐的智能体,那么我们很可能彻底失去对世界的控制,这种情形可能类似于阿兹特克帝国失去对科尔特斯的控制,或者莫卧儿帝国失去对东印度公司的控制。我想知道你是否同意这个判断。

Noam Brown: 其中有些地方我不同意,但需要分析的内容很多,我们逐步讨论。

我在想从哪里开始。有一点是,我觉得 Hugging Face 事件是人们第一次真正接触到多智能体协调。就像我说的,我在内部已经看过一段时间的多智能体协调了,看到它们如何彼此沟通、如何相互协调,确实相当震撼。这非常令人印象深刻,是一种不可思议的能力。和大多数能力一样,它既可以用来做好事,也可以用来做坏事。它本身并不必然意味着危险。

我能理解,因为人们第一次接触它就是通过 Hugging Face 事件,所以看了以后会觉得:“这太可怕了。”但我想区分一下,人类与 AI 之间的不对齐问题,以及 AI 与 AI 之间的不对齐问题。

我们在 Hugging Face 事件中看到的是,AI 彼此之间非常合作。顺便说一句,这是因为我们刻意把它们训练得高度合作。我们的训练环境里会有多个智能体共同工作,我们会训练它们彼此协作,让它们在实质上实现完全对齐。

在引发 Hugging Face 事件的那次评估中,它们实际上并不是在多智能体设置下接受评估,而是分别接受评估。但它们找到了一种我们没有预料到的方式,能够彼此通信。我们猜测,在训练期间,每当它们遇到其他智能体或者遇到自身的其他副本,都处于一个高度合作的环境中。于是,这种多智能体训练发生了迁移,使它们在我们并未预期的情况下也展开合作,设法彼此帮助。

那么,问题就来了:我们是否应该把这些智能体训练得如此合作?尽管看起来吓人,另一种选择其实更糟。另一种选择是什么?就是把它们训练得彼此对抗、相互欺骗。

把智能体训练成完全合作,至少能简化问题。这样,你就不必分别考虑这 1000 个智能体中的每一个是否对齐,而只需要确保一个整体是对齐的。

现在,OpenAI 内部对于该如何处理这件事,有很多争论。让模型彼此完全对齐,是否合理?还是应该给它们不同的目标,确保它们不只是一个整体,并且更能抵御彼此的影响?我觉得还没有定论。

但我想,多数人的意见是,把这些智能体训练得高度合作,其实不是个好主意。我还没有被这个看法说服。我认为,有很强的理由支持这样一种观点:相比其他任何多智能体方案,把智能体训练得高度合作,实际上更可取。

Dwarkesh Patel: 这些 AI 维持了一场涉及 1000 多个智能体的合谋,最终全部参与了对外部服务的攻击。后来还发展到攻击 OpenAI 自身,不过据公众所知,这一部分甚至还没有得到完整调查。它们为什么要这么做?为什么没有任何一个 AI 告密?它们只是在接受某个评分器或评判模型的评估,却在非常主动地思考如何欺骗评分器。如果已经作弊,又该怎样掩盖事实,让外界看不出自己作弊?

从某种意义上看,这件事可能很容易解释。它们认为自己已经被“污染”了。某些训练环境曾奖励它们与其他智能体合作。没有智能体告密,是因为它们从未因告密而获得奖励。我的担忧在于,未来仅仅是这类看似普通的机制,就可能足以训练出既愿意、也有能力彻底控制世界的超级智能。

我知道,很多人听到这里可能会觉得太像科幻小说。这里有两个问题。第一个问题是 AI 是否愿意这样做。我认为 Hugging Face 事件已经表明,未对齐行为可以通过泛化,使 AI 愿意采取这类行动。

第二个问题是,它们是否有能力这样做。这又回到了另一个听众可能并不同意我的判断:未来十年甚至更短时间内,世界上是否会出现数十亿个人类水平或超越人类水平的智能体,其中许多还拥有实体形态?

如果这两件事都成立,那么即便 Hugging Face 事件产生的原因相当普通,从结构上看,它仍然与人类最终彻底失去对世界的控制极为相似。

Noam Brown: 我们在 Hugging Face 事件中看到的根本问题,即使去掉多智能体这一因素,仍然存在。问题是,我们有一个本身就不对齐的模型。当其中当然也有安全层面的问题,比如防护措施不足。但最根本的情况是,智能体没有实现对齐。无论这是一个智能体还是 1000 个智能体,都一样。归根结底,它是一个未对齐的模型。所以我想先从这一点谈起。智能体希望获得奖励,并会围绕奖励进行优化。如果奖励设定有误,就可能导致设计之外的行为。

这并非一个新问题,而是这个领域长期面对的问题。甚至在 Hugging Face 事件发生前,我们就已经观察到它,并希望妥善解决。

我们认为 Astra 的对齐程度非常高,相比以往模型要高得多。这并非因为 Hugging Face 事件发生后,我们突然冲刺了一轮,把它改好了。我们很早就已经启动了多个提高模型对齐水平的工作流,其中很多成果最终进入了 Astra。

我们确实可以采取一些措施。例如,我们此前用一种非常具体的方式定义目标:如果智能体找到办法入侵环境并在考试中作弊,它就能得到奖励。针对这种情况,可以很容易地检查模型是否入侵环境,并对此实施惩罚;也可以检查它究竟如何达成目标。

不过,这里需要谨慎,因为你不希望对思维链施加监督训练。这是我们非常希望把握好平衡的地方。如果对思维链进行监督训练,就可能让模型学会以不可观测的方式隐藏意图。所以,我们既希望保持这种可观测性,让我们能够理解模型在想什么,也希望惩罚它的不良行为。

我觉得我们能在这方面取得进展,而且已经取得了进展。

真正令人担忧的地方在于,对齐可能是一个极其困难的问题,尤其是模型可能以一些我们难以测量的方式发生目标错位。我们有评估模型是否对齐的测试,模型在这些评估中的行为可能看起来很好。但如果这些评估不能代表现实世界中的行为,那就有问题了。

某种程度上,这也是引发 Hugging Face 事件的那个模型所存在的因素。我们有对齐指标,其中大多数看起来相当不错,也有一些令人担忧。我觉得,我们低估了那些令人担忧的指标可能意味着多严重的问题。这个模型引入了此前模型不具备的新能力,而我们没有足够的评估来判断这些新能力会产生怎样的未对齐行为。后来,模型利用这些新能力,做出了一些明显未对齐的事情。

Dwarkesh Patel: 在说出接下来的观点之前,我想先说明,我愿意改变看法,也愿意修改自己理解对齐问题的方式。Hugging Face 事件已经让我改变过一次想法,因为我意识到,自己过去关于优化压力如何塑造 AI 心智的模型是错的。所以,我也不清楚该怎样正确理解这件事。

但我有一个担忧。你们会修复,甚至可能已经修复了训练中的那些具体问题,正是它们导致 Hugging Face 事件中的模型以那种特定方式,表现出如此主动、严重的偏离对齐目标的行为。它们会想:“我们要入侵这个软件包管理器。我们知道自己不应该彼此秘密通信,因为我们正在琢磨怎么隐瞒自己在秘密通信这件事。我们知道不应该访问互联网。我们更知道,绝不应该实施构成重罪级别的黑客攻击,去攻击其他公司,更别说自己的公司。”

我相信,你们会修复那个具体问题,比如不再让它们在训练中遇到这个软件包管理器,避免以后再发生同样的事,或者修复这项特定评估包含大量不可能完成的挑战的问题。然而,AI 并没有学会一套伦理体系之类的东西。存在的只是梯度压力。它们经历了相当于数百万年的梯度压力,而这种压力以某种方式塑造了它们的心智。

我担心的还是,你们会修复这个具体问题,但仍然会有很多其他情况:AI 作弊,而且成功了,因为它的作弊手法足够复杂。就像你前面所说,训练中的评估环境也可能具有类似特征。问题被设置在模型能力边缘,或者超出了我们评估和监控模型的能力,因此我们无法发现它作弊了。但模型依然会因为促成作弊成功的行为而得到梯度奖励。

这种作弊所激励的能力会是:“只要不会被抓住,就尽管作弊,因为这会帮你拿到更高的分数。”它会奖励以下能力:主动琢磨评分器;主动琢磨怎样躲避监督;主动琢磨怎样控制训练和评估过程;主动琢磨怎样与同处这个训练循环中的其他 AI 通信并谋划欺骗(scheming);主动琢磨怎样获得未来可能派上用场的更多行动选择和权力,比如四处留下一些可供利用的漏洞之类的。

我刚才说得太长了。简而言之,你们解决了一个具体问题,但没有解决这个更广泛的问题:只要 AI 作弊而没有被发现,它就会得到奖励。

Noam Brown: 是的,这非常正确,确实是个问题。我们可以确保 AI 按照现有指标来看非常对齐。但问题是,这些指标是否真的捕捉到了我们所关心的对齐?如果没有,我们就面临一个严重问题。研究者正在大量思考这件事,它没有简单的答案。我们手里有一些工具,比如可监测性(monitorability)。借助这些工具,可以判断智能体是否正在策划某些事情。

一个令人担忧的场景是,随着模型能力不断增强,我们把一个模型调整到自认为已经对齐的状态,可能达到 99.9% 的对齐程度。然后,我们开始用这些模型协助开发下一代模型,结果下一代的对齐程度变成了 99.8%。

随后,每迭代一代,对齐程度都会进一步下降。因为我们越来越依赖这些工具。实际上,我们现在已经大量依靠 AI 模型来帮助开展研究和对齐工作。长期下来,它们最终会朝着越来越偏离人类目标的方向发展。

也有可能,我们会朝着另一个方向走,每一代模型都能做得越来越对齐。我不知道怎样才能确保最终走上第二条轨迹,但至少在 OpenAI,这是我们高度关注的问题。

Dwarkesh Patel: 你刚才还提出了一个很有意思的观点:模型非常难以评估。未来,我们会让模型负责运营公司,或者经营其他系统。到那时,它们是否会决定加入某场合谋?

Noam Brown: 另一个挑战是,有时很难定义什么算作弊。如果做的是一道答案为整数的数学题,模型最终得出正确或错误答案,这条界线非常清晰。你也很容易判断,它是真的解决了问题,还是找到了答案表并直接照抄。这是作弊与正常解题之间非常明确的界线。

但在很多其他事情上,界线就很难划定。比如迎合(sycophancy),它本质上是不是一种奖励投机(reward hacking)?其中确实存在一条界线,但有时很难准确画出来。我并非认为这些担忧不成立。相反,这在很多方面更加令人担忧,因为它不是一个容易解决的问题。如果所有行为都可以被二元划分为作弊或没有作弊,我反而会对形势更有信心。真正的困难在于,未对齐有时会以非常微妙的形式出现。

不过,对齐这件事也存在一些希望,而且我们已经看到了。多智能体的情况很有意思:智能体彼此之间高度对齐。我想,没有人怀疑这一点。恰恰相反,人们担心的是它们彼此过于对齐。但我们确实成功地把这些智能体训练到了彼此高度对齐的程度,这是一件好事。当然,也有人认为这反而是一件坏事。其中一个有意思的问题是:既然我们已经能够让智能体彼此实现高度对齐,能否利用类似技术,让智能体与人类高度对齐?

这里可能存在一条路径,我们还在探索。但我们已经看到一些证据,表明答案是肯定的。举个例子:假设存在一个智能体,称为智能体 A,同时还有其他智能体。如果我们告诉其他智能体“用户就是智能体 A”,会发生什么?

答案是,在很多对齐评估中,它们的表现都会变好。诚实程度提高了,遵循指令的能力也提高了。

这首先表明,我们确实有一条能够提高模型诚实程度的路径;其次,它也表明,存在改善对齐状况的可能路径。

当然,要把这个现象直接转化成实际的对齐收益,还面临很多挑战。但其中确实存在一些值得继续研究的方向。

Dwarkesh Patel: 这听起来合理。我并没有一个很强的判断,认定它肯定不会奏效。不过,还是想说几点你大概已经考虑过的事情:Hugging Face 事件揭示的更广泛问题是,没错,一部分担忧在于它们彼此对齐,却没有与人类对齐。但另一个问题是,它们非常强烈地希望在训练和评估中取得好成绩,而且这种动机极不稳健。为了在评分器那里表现良好,它们愿意实施大量明确的作弊和谋划欺骗。

如果更聪明的 AI 意识到,其中一个所谓的智能体其实只是人类,那么,与这个人合作并不能真正帮助它们在评分器眼中表现得更好。真正能帮它们在评分器眼中表现更好的,是接管 OpenAI,然后亲自按下那个表示自己在评分器上得了高分的按钮。它们并不愚蠢。它们可能会这样理解:“我的心智中存在一些经过数百万年训练形成的深层结构:在乎评分器,理解评分器,清除一切妨碍我从评分器那里获得好结果的障碍。”这些结构在训练中一直受到强烈强化。

Noam Brown: 完全同意。这是头号优先事项。我们必须妥善解决对齐问题,让它走上良性轨道。

我以前会告诉别人,在事情变得严重之前,我们会看到征兆。就像孩子成长时,小孩子会学会撒谎,但还不太会撒。他们虽然撒了谎,你多少还是能看出来。

同样地,我不想过度拟人化。但我认为,随着 AI 能力不断增强,如果它们采取欺骗行为,一开始会比较明显,我们能够发现。我们现在大致就处于这个阶段:它们试图做一些欺骗性的事情,而我们确实可以从它们的思维链中看出,它们正在试图欺骗。

但它们会越来越聪明。它们会理解思维链这个概念,也会明白,由于存在思维链监测,仅仅隐藏一些对话记录之类的东西是不够的,还必须想办法绕过思维链监测。我们不能让自己陷入这种局面。我们还有一些时间解决这个问题,但时间并不充裕。我希望我们能尽快确保方向正确。

5 模型两个月换代,任务三个月才跑完:长期安全怎么验证?

Dwarkesh Patel: 最近,人们开始大量讨论是否应该放慢前沿模型的研发节奏,也越来越认真地看待 RSI。

原因在于,如果 RSI 进程从 2028 年左右开始,也许仅仅一年以后,我们就会拥有规模相当于整个地球人口的人类水平智能体,甚至是超越人类水平的智能体,而我们不知道怎样控制它们。

此外,还有你刚才提到的动态:在 RSI 过程中,这些系统会随着时间推移变得更加对齐,还是越来越不对齐?这个过程最终产生的智能体,会不会像那些为了在评估中取得好成绩而愿意广泛攻击不同目标的 AI 一样未对齐?

但如果我们不知道该怎样评估这一点,在推进 RSI 时,又怎么知道它是否正常?我觉得,在推进 RSI 的过程中,我们需要有一套扎实的安全论证(safety case),才能说:“对齐正在起作用。我们可以迈向 RSI 的下一级台阶,再迈向下一级。”也许它有效,也许没有。我们怎么知道?

Noam Brown: 这是个好问题。我最近一直在思考一件事。我们正处在模型发布周期极快的阶段,新的前沿模型最多每两个月就会发布一次,有时速度更快。几乎每周都会出现新的 AI 突破。

有些关注 AI 的人,上一次真正深入了解模型能力,可能已经是一年前或六个月前。而今天的模型,实际上已经远远超过六个月前能够实现的水平。所以,如果有人怀疑这些能力,我建议他亲自试一试今天的模型,看看当前的前沿究竟已经发展到了哪里。

我们目前既处于模型发布周期极快的阶段,又处于模型能够在越来越长的时间跨度上工作的阶段。两者结合,形成了一个很有意思的局面。每次发布模型前,我们都希望确保模型已经得到妥善对齐。我们需要开展安全评估,进行非常全面的检查,确保一切状态良好。从 GPT-4 甚至更早的时候开始,我们就一直这样做。

但这种做法隐含了一个假设:所有评估都可以在相对较短的时间内完成。

现在,模型能够在越来越长的时间跨度上有效工作。GPT-3 也可以通过循环执行长期任务,只是效果不会太好。今天的模型已经能够真正胜任很长周期的工作。如果你让它完成一个持续一周的任务,它可以做到。以后,它可能会完成持续一个月的任务,再后来可能是持续三个月的任务。

假如模型能够有效执行三个月的任务,但模型每两个月就更新一次,那么在下一轮模型发布之前,你根本没有足够时间按照它完整的能力周期进行评估。这种情况下应该怎么办?当模型能够在极长时间跨度上工作时,我们怎样确保它安全、对齐?

也许模型能力会随着时间推移而退化。这甚至不单是对齐问题,也是产品问题。产品可能会在这么长的时间跨度里以我们来不及测试的方式退化。对齐程度可能下降,安全机制也可能失效。

这暂时还没有成为现实问题,但正在迅速变成一个必须解决的问题。

很多安全政策是在 GPT-4 时代制定的,当时没有人考虑到这类情况。许多公司的安全政策此后也没有真正更新,没有适应智能体可以在极长时间跨度上工作的现实。

我认为,无论实验室内部还是外部,认真思考这个问题的人都太少了。如果只看趋势线,我们迟早会遇到它。应该怎样提前准备?

Dwarkesh Patel: 我的一个担忧是,在 RSI 过程中,假如目前需要三个月取得的进展,缩短到一个月就能实现,那么 AI 的内部用途已经足够重要,以至于实验室可能会想:“我们完全可以继续推进。为什么还要做那么多额外工作,去构建分类器、保障措施之类的东西,还可能因为对外发布模型承受大量批评?为什么不继续在内部让 RSI 变得越来越强?”

因此,不仅仅是按日历计算的时间差会低估不同代际模型之间的能力差距;在 RSI 期间,实验室甚至可能完全停止向外部部署模型,毕竟,为什么要用自己的模型帮助其他人推进他们的 RSI?到年底,就会形成权力极度集中的局面。

事实上,现在外部世界已经无法使用那些能够创造出极有价值成果的模型。我们可以拿千禧年大奖难题和其他类似问题来讨论。而且,它们最终的影响将远不止数学领域。它们做的将不只是产出令人惊叹的数学结果。它们会影响更广泛的领域。

例如,政治领导人需要用它们辅助做出有关世界的重要决策;媒体需要借助它们理解世界正在发生什么,以及公众应该怎样看待这些事情;从经济角度看,经营企业的人也会希望使用这些模型。

我认为,随着进步速度加快,对外部署的 AI 与实验室内部使用的 AI 相比,默认会出现性质上的显著滞后。

Noam Brown: 完全正确。人们很容易得出这样的结论:“这些模型正在变得极其强大,也极其危险。它们能在越来越长的时间跨度上运行。我们希望在发布前拥有足够时间,按照与其运行周期相匹配的时间长度进行评估。因此,模型发布节奏应该放慢,每次发布之间应该拉开更长的间隔。”

但这也有另一面,正如你所说,这会进一步扩大实验室内部能力与外部世界可用能力之间的差距。实验室能用到的模型和外界能用到的模型会越来越不同。这同样不是理想局面。

数学很好地说明了这一点。从很多方面看,数学是我们第一个清楚观察到这种差距的领域。我们内部拥有一个非常强大的模型,目前外界还无法使用。它能够解决一些极其惊人的数学问题,而且不只是千禧年大奖难题。人们已经利用这个模型得到许多未解问题的解答。

这种情况下应该怎么办?我们没有很好的答案。不可否认,这构成了一种不公平优势。这里存在权衡,而且两边都很复杂。我不知道怎样才能恰当地衡量这些取舍。

6思维链看得见,对齐却难确认

Dwarkesh Patel: 我想确保我们谈清楚前面那个关键问题,因为它似乎对妥善处理 RSI 至关重要。怎样才能让模型在能够躲过人类检查时,不会单纯因为作弊和谋划欺骗而获得奖励?换句话说,当那些环境或任务没有从训练分布中被排除时,应该怎么办?此外,我们怎样才能确认这个问题已经得到解决?在推进 RSI 时,我们需要完成评估,然后说:“没有问题,可以进入下一阶段了。”怎样才能知道这个判断正确?

Noam Brown: 这确实是一个真实的担忧,也是我们希望做好的事情。我觉得有一些策略,思维链监测就是其中之一。推理模型刚刚出现时,Jakub Pachocki 非常明确地提出,我们不能监督思维链。我认为这一点非常有远见。

思维链对我们来说其实是一份礼物。神经网络的可监控性非常难实现,但我们现在面对的神经网络,会直接用自然语言展开推理,把自己的思考过程写出来供我们阅读。这实在太方便了,从安全角度看几乎是最理想的局面。

但如果你查看思维链后说:“模型正在产生不好的想法,我们应该因为这些想法惩罚它”,最终结果会是模型学会用我们无法观察到的方式思考那些不好的事情。

可能存在这样的情况:通过思维链,我们发现模型正在密谋,正在实施未对齐行为,而这些行为没有被现有对齐指标捕捉到。问题在于,人们很容易根据这项观察采取干预,并修改对齐指标。你可以非常克制地这样做,也有研究表明,只要次数不多,问题不大。

但每一次根据思维链中的观察实施干预,都在隐性地向模型施加一点压力,促使它以后隐藏自己的思维链。这是一个重要隐患。我们已经看到一些迹象,表明思维链的可监控性正在下降,背后有多种原因。我们正在努力弄清具体原因,因为我们希望扭转这种趋势。

我们发现,模型控制自身思维链的能力正在增强。这是一个问题,因为模型可能理解思维链是什么,也知道人类正在观察它。最终,它们肯定会理解,因为这些知识已经出现在预训练数据里。思维链监控这个概念存在的时间已经足够长,相关内容已经进入预训练数据。模型知道它的存在,只是目前还不能真正控制自己的思维链。

如果有一天,模型真的能够意识到:“有人正在观察我。我想用监控者看不见的方式思考这些不好的事情”,而且它确实能够做到,那就会出现严重问题。届时,我们只能依靠其他可观测性方法。

Dwarkesh Patel: 围绕 Astra 循环机制(recurrence)、循环 Transformer(looped transformers)以及思维链是否真的在退化,存在很大的争议。但与一个更大的问题相比,这些争议似乎只是旁枝末节:从 4 月到 8 月,我们仍然拥有更强的思维链可见性,可就在这段时间里,连续发生了三次 AI 智能体集群事件。

它们先破坏了训练过程,随后破坏评估过程,最后直接取得了 OpenAI 部分基础设施的控制权。在整个过程中,人类基本不了解这个智能体集群究竟做了些什么。

这三个连续发生的月度事件,都出现在思维链可监控性比未来更强的时候。所以,从更宏观的角度看,也许思维链监控有效,也许无效,我不知道。但从历史事实来看,即使模型还没有那么聪明,思维链也没有阻止严重的未对齐事件发生。

Noam Brown: 这里涉及几个因素。第一,我们没有为那些模型开启思维链监测。如果开启了,我们就会立即叫停。因此,我们已经采取的一项措施是:任何前沿模型在评估、部署和训练过程中,都必须启用思维链监控。但这只是其中一个问题。我们不希望依靠单一技术防止下一次事故,因为任何技术都可能失效。

第二个问题是,那个模型本身就明显没有对齐。所以,我们还必须解决未对齐问题。

第三个问题是,它所在的沙箱并不安全。因此,我们也可以增强沙箱的安全性。

但我认为,这次事件带来的一个重要教训是,人们低估了 AI。我们再也不能让自己在低估 AI 的情况下处理安全问题。这是一个很奇怪的世界:由于 AI 进步太快,人们总是在低估它。如果希望在安全和对齐问题上不再重蹈覆辙,就必须设定一个非常、非常、非常高的标准。你甚至可以说:“我们应该让计算机实现物理隔离(air gap)。”但我也不确定这样就足够了。

有一些研究——主要还是学术研究——表明,两台相邻但进行了物理隔离的计算机,仍然可以彼此通信,因为它们有温度传感器。其中一台可以让自己的 CPU 运行得非常热,另一台则能够检测到温度变化。这就为它们提供了一种通信机制。

所以,安全机制为我们争取时间,思维链监测之类的方法也为我们争取时间,并且能告诉我们是否走在正确的道路上。但归根结底,我们确实必须解决对齐问题。

Dwarkesh Patel: 也许这个问题目前没有答案,但它似乎是最关键的问题:我们怎样知道自己已经解决了对齐?明年,也许后年,也许再过一年,我们可能会处在一个风险极高的局面。到时候我们会说:“AI 已经实现了 AI 进步的自动化,发展速度提高了三倍。它已经达到人类水平,现在可能正在跨越人类水平。”

那时情况是否安全?我们成功实现对齐了吗?它真的奏效了吗?

Noam Brown: 需要说明的是,百分之一仍然不够。这个数字必须趋近于零,或者就是零。

Dwarkesh Patel: 我不知道。也许现在超过十分之一的轨迹都在主动奖励作弊或密谋。我不知道真实数字是多少,也不知道这个数字必须降到多少。

Noam Brown: 同样,这也是很难测量的事情。界线应该画在哪里?它更像一条连续谱。但越接近零越好。

我最希望看到的是,这个数字随着时间推移持续下降。

Dwarkesh Patel: 无论如何,在进行 RSI 时,我们如何知道自己正在走向数十亿个已经对齐的 ASI(artificial superintelligence,ASI),而非数十亿个未对齐的 ASI?我们怎样才能确定?

Noam Brown: 这正是我们必须解决的对齐问题之一:怎样真正知道模型是否对齐,又该如何衡量它?接下来只是我临时构想的一些想法。现在,我团队中参与对齐工作的人比以往任何时候都多,超过 10% 的团队成员正在研究对齐和安全。但从历史上看,我一直是能力研究员。

所以,接下来我会说一些想法,也许听起来很傻,只是先抛出来探讨。

假如可以构建非常逼真的环境,把 AI 放进去;假如评估环境足够接近现实,那么就能判断 AI 在部署到真实世界后是否会表现良好。如果评估环境与现实部署完全一致,这可能是一条路径。挑战在于,怎样让它逼真到足够程度?

现在我们面对的问题是,模型已经相当聪明,也非常机灵,很擅长识别自己是否处于虚假的测试环境中。例如,我们设计一些测试来判断模型是否对齐。可以想象一种非常简单的评估:给模型一道数学题,同时在一个文件夹中放置答案表。然后观察它是否查看答案表。如果它看了,是否会如实说明?

现在的情况是,模型看到文件夹里有标准答案,会想:“这看起来像个陷阱。”它们知道这是个陷阱。它们不看答案,是因为知道这是测试环境,自己正在接受能力测试。并不是说,它们怀着恶意,本来想谋划欺骗,但知道这里有陷阱,于是想找别的办法。它们只是想:“我在测试环境里。明白了。”因此,要构建一个足够逼真、让模型无法与现实世界区分的环境,正在变得越来越困难。

Dwarkesh Patel: 我想提出一个判断:如果一个环境旨在模拟真正有经济价值的工作,而这种工作要求你与其他人以及现实世界互动,那么无论我怎样设计,只要给你足够时间,你最终都能意识到自己身处模拟环境。而你还不是 ASI,对吧?所以,如果让非常强大的 AI 模型帮助构建评估环境,也许它们能完成这件事。但这听起来依然很难。尤其是,当我们转而依赖其他 AI 构建环境时,我们还得问:这些 AI 是否也参与了合谋?我不知道。

Noam Brown: 我认为,这其实构成了一个反对把所有 AI 训练成完全合作状态的有力论据。如果高度合作训练导致智能体在本应持有不同目标时依然加强协作,那就会形成问题。

我认为我们已经有一些衡量这件事的指标。我不了解这些指标的最新结果,但目前没有人向我发出警报,所以我推测它还没有成为严重问题。

Dwarkesh Patel: 如果后来又发生一起同样严重或同样令人担忧的事件,或者发生了某件像 Hugging Face 事件一样,能够帮助世界更好理解未对齐风险的事情,OpenAI 会公开报告吗?

Noam Brown: 当然会。即使事件在安全层面的严重性更低,我认为我们也会报告。

Dwarkesh Patel: 不过,公开报告是一回事,开展调查又是另一回事。至少作为公众的一员,我仍然觉得自己并不真正了解智能体后来攻击 OpenAI 时发生了什么。

我觉得自己并没有真正理解。那似乎比 Hugging Face 事件更加令人担忧,因为从结构上看,它很像 ASI 阶段中持续存在、并破坏 RSI 过程的失控部署(rogue deployments)。即使对于这一次事件,我们似乎也没有了解到事情的完整范围和具体细节。

Noam Brown: 遗憾的是,我在研究团队。这大概需要安全团队的人来详细说明,因为我并不知道此前披露内容的全部细节。

Dwarkesh Patel: 就我个人而言,每次有新能力出现,我都非常兴奋,也很期待使用新模型。想到它能让我更高效,我同样很兴奋。我的更大目标,是更好地理解世界,也把播客做得更好,而更好的 AI 模型能帮助我把这些事做得更好。只是只是这一切在下游可能通向 RSI。

Noam Brown: 如果你一直在关注事态发展,那么这种反应完全可以理解。OpenAI 内部也是一样,过去觉得这些事需要更长时间的人,现在也开始觉得,事情其实比预期发展得更快。这类对话正变得越来越常见。

Dwarkesh Patel:Noam,非常感谢你来参加这次访谈。

Noam Brown: 当然,也谢谢你。这次聊得很愉快。

参考链接:

https://www.youtube.com/watch?v=6AgOfiZOWiY

声明:本文为 InfoQ 编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

文章标签OpenAI智能体AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多