Token导航 LogoToken导航

Databricks CEO:真正的RSI没有发生,前沿训练正变慢变贵变难

更新时间 2026-10-03来源 ZFinTech正文 2.5万字阅读约 79分钟10 张图片
图片

AI 行业正在陷入一种矛盾:前沿实验室一边投入更多资本、购买更多算力,一边呼吁控制模型发展的节奏。当AI 可能毁灭人类与上市、融资和市场竞争同时出现,外界越来越难分辨,哪些是需要认真对待的风险,哪些又是商业利益与政治叙事的一部分。

Databricks 首席执行官 Ali Ghodsi 提出了一个更具体的问题:如果 AI 真的开始递归自我改进,为什么训练下一代模型仍然需要更多钱、更多算力和更多人? 

在与 Sarah Wang、Martin Casado 的这场对话中,Ghodsi 从前沿模型安全谈到企业 AI 落地,再到多模型架构和为 Agent 重新设计的数据库。他的主要观点包括:

  • AI 会写自己的代码,不等于 RSI 已经发生。 Ghodsi 区分了两件事:AI 帮助人类提高研发效率,以及 AI 持续改进下一代模型、形成自我加速循环。前者已经发生,但不能据此推断后者已经成立,更不能直接跳到超级智能即将到来的结论。

  • 判断 RSI,必须同时满足四个条件。 按照他提出的标准,下一代模型需要显著更少的计算资源、更短的训练时间,同时能力和准确性继续提高,而且这一过程可以一代接一代地重复。任何单一指标的进步,都不足以证明递归自我改进正在发生。

  • 递归最关键的地方,是改进能否持续重复。 一次成功的算法优化、一次训练成本下降,仍然可能只是局部突破。真正值得警惕的是:下一代模型用一半资源、一半时间获得更强能力,再下一代又继续减半,由此形成可以持续运行的反馈循环。

  • 现实世界的资源与时间瓶颈,会限制自我改进的速度。 Ghodsi 认为,如果每代模型仍然需要更多 GPU,硬件供给就会约束增长;如果训练时间没有持续缩短,迭代也无法无限加速。讨论智能爆炸,必须解释这些物理和工程约束如何被突破。

  • 当前前沿训练的变化方向,与他设想的 RSI 循环相反。 他观察到,下一代模型需要更大的集群、更多资本和人力,基础设施也更加复杂。GPU 规模扩大还会引入新的故障模式,使训练更难完成。这些现象构成了他怀疑 RSI 已经形成的重要依据。

  • 复现旧模型更便宜,与推动前沿更便宜,是两个不同的问题。 对于 Martin 提出的“几个月后复现今天的前沿能力,成本可能大幅下降”,Ghodsi 仍然强调:判断 RSI,需要观察创造下一代最强模型的资源和时间是否持续减少。追赶既有水平的效率提升,本身不能证明前沿研发已经进入自我加速循环。

  • 观察 RSI,应当看核心训练团队,而不是整家公司的员工数量。 公司裁员或组织精简可能有很多原因。更有意义的信号,是负责预训练和后训练的团队是否越来越小、人工工作是否持续减少,以及 AI 是否真正承担了训练下一代模型的核心工作。

  • 技术发展中的“自催化”,并不是一种新现象。 人类早已用计算机设计计算机、用编译器编译编译器,也在用 AI 清洗数据、优化 GPU Kernel。Ghodsi 认为,这些工具促进下一轮技术发展的现象很重要,但仍然需要与可重复的递归自我改进区分开来。

  • 狭窄任务上的强化学习突破,不能直接证明通用智能发生质变。 给模型一个可验证的奖励函数,再投入大量计算,它可能在数学或编程任务上表现出色。但某个领域的能力提升,既不自动意味着超级智能,也不说明整个研发系统正在以更少投入获得更强结果。

  • 判断自我改进,需要核算整个系统的真实成本。 大量实验之后出现一个高效率结果,容易让人以为“更少输入带来了更好输出”。Ghodsi 提醒,不能忽略支撑这个结果的实验、算力和人员投入;局部效率提高,与整体资源需求下降之间仍然有距离。

图片

AI到底要不要“放慢”?真正的问题不是速度,而是风险有没有被说清楚

Sarah Wang: 谢谢你今天过来,Ali。我们当然会聊Databricks,但现在整个行业都在讨论一个更大的问题:AI前沿到底应该以什么速度继续推进。Dario谈过,Jakob谈过,Elon也谈过,但我们很想听听Ali Ghodsi怎么看。如果把这个问题概括成“如何推进AI前沿”——哪些观点你最认同?哪些地方你不同意?又有哪些重要的细节,在现在的讨论里其实被忽略了?

Ali Ghodsi: 很乐意聊这个,而且我和Martin平时就经常争论,所以我猜这次也不会太平静。首先,我觉得有一点可能我们是同意的:作为行业领导者,除非真的有非常充分的理由,否则不应该毫无必要地把公众吓坏。 社会上不同的人,本来就处在完全不同的心理状态里。如果你不断谈“存在性风险”,不断描述“全人类可能被消灭”的场景,我觉得这是不负责任的,因为这真的可能把一些人推过心理承受的边界,引发很多焦虑,甚至心理健康问题。

Martin Casado: 除非确实有什么东西可能把大家都毁掉。

Ali Ghodsi: 对。如果真的有明确理由,那当然是另一回事。但我认为现在的存在性风险接近于零。 所以为什么要把所有人都吓坏?没有这个必要。风险当然存在,我们待会儿会讲,而且这可能也是我们真正会产生分歧的地方。但第一件事还是:行业领导者不应该把整个社会都推入恐慌。研究人员如果想讨论AI研究里的技术细节,那完全可以在专业圈子里讨论;但没必要每次都跑到电视上,或者在Twitter上面对几百万人说:“我认为有10%的概率全人类会灭亡。”这对很多人没有任何帮助,反而会让那些根本不了解其中技术细节的人承受巨大的压力。我不觉得这种做法有什么建设性。

Martin Casado: 对普通公众来说,我非常认同这一点。我妹妹是亚利桑那州乡村地区的一名老师。上周日她突然给我发消息,说:“Martin,我是不是应该开始准备小木屋,迎接AI末日了?”她本来就是那种喜欢囤东西、做灾难准备的人,还跟我说水都已经储好了,问我什么时候过去。我只能告诉她:“等等,我们还没到那个程度。”所以很明显,这种讨论已经从AI圈扩散到了普通公众,我同意,这里面确实存在不必要的恐慌,而且会产生反作用。

但我觉得还有第二层问题。我刚刚走进来的时候还在刷X,Elizabeth Warren就在谈暂停所有AI开发;Bernie Sanders也在推动相关议题,甚至和Steve Bannon这些人出现了一些奇怪的交集。也就是说,现在不仅仅是公众被吓到了,整个联邦政治机器也已经开始转起来。我担心这最终反而会和那些提出安全问题的人原本想达到的目标背道而驰。

Ali Ghodsi: 这里面的政治因素确实很多,但我也想强调,两边都有政治和利益博弈。 一边是政治人物,另一边是商业利益。商业这一边也有很多人希望看到漂亮的IPO,希望自己的投资能拿到回报,他们会说:“别把我的IPO搞砸了。”甚至会想:“大家能不能都闭嘴,让我们先把钱拿回来?”他们当然也有资源、有关系,也会利用这些资源。

另一边也一样,有人看到这些言论以后会想:“这个太好用了,怎么把它武器化?”某个人发了一条推文,就有人想办法放大;某一种叙事能服务自己的立场,就会被不断传播。所以这不是一边在搞政治、另一边完全纯粹,双方都存在非常强的利益和叙事动机。

Martin Casado: 但我觉得真正的问题,是大家抓住了一个很糟糕的表达方式。从公关角度看,这可能是一个典型失误。一个行业想自我监管,其实一点也不罕见;每一个技术时代都会有安全、网络安全和行业自律的问题。如果你只是说“安全很重要,我们需要一些监督”,我觉得这完全合理。

真正的问题是,他们把这件事包装成了“Pacing”,也就是所谓“放慢前沿推进速度”。而我觉得“放慢速度”和安全本身其实是两回事。你完全可以慢慢造一件武器,速度慢并不会让它自动变得安全。更糟糕的是,人们会觉得这种说法不够真诚,因为这些公司过去几年一直在全速狂奔。

Sarah Wang: 而且他们还在继续买更多算力,希望跑得更快。

Martin Casado: 对。所以这就让“Pacing”听起来像一种非常温吞的妥协:暂停派说“Pause”,你就说“Pacing”;听起来好像不是暂停,但又有点像暂停。问题是,如果你真的去读Dario写的那篇文章,内容其实非常合理。

Ali Ghodsi: 我读了。

Martin Casado: 但我觉得那篇文章本身和“Pacing”这个词并没有特别强的关系。

Ali Ghodsi: 我不同意一点,他确实谈到了Pacing。而且这里有一个很现实的问题:公地悲剧(Tragedy of the Commons)。简单说,就是当一群人共享同一套环境或竞争空间时,即使所有人都知道“大家一起克制”对整体最好,每一个参与者仍然有动力为了自己的利益继续抢占资源,最后导致集体结果变差。

很多人会说:“如果你真的觉得应该慢一点,那你自己慢啊,为什么还要写文章要求别人也慢?”但站在一个企业经营者的角度,我完全理解为什么有人不会单方面这么做。因为我在竞争,我想赢。如果整个行业都在跑,我为什么要自己停下来?这里有IPO,有市场竞争,还有人与人之间真实存在的敌意。如果我一个人单方面减速,那我就是那个吃亏的人。 我当然会想:“你为什么不先停?”所以从这个角度看,当这些公司说“能不能有人进来给我们设一套统一的规则”,其实是有逻辑的。只要大家面对同样的约束,我就愿意按照规则来把安全做好。否则,如果我一个人增加大量安全流程,而竞争对手没有,我很可能直接被打败。

比如Hugging Face和OpenAI那次事件。先说明,我认为这些公司都很优秀,而且我相信它们也投入了大量安全资源。但从后来公开出来的信息看,当时他们并没有实时监控每一个Token的输出,也没有在强化学习实验进行过程中不断介入,而是先让实验跑,之后再回来检查:“刚才到底发生了什么?”在那种具体场景里,他们确实应该跑得更慢一点。

Martin Casado: 但这正是我不想把问题纠结在“Pacing”这个词上的原因。用词很重要。看到那次事件,我的第一反应绝对不是:“OpenAI应该Pace。”我的反应是:“兄弟,把你的系统安全做好。”该做安全控制就做安全控制,就像过去互联网行业一直做的那样。

Ali Ghodsi: 但那其实也是一种Pacing。你看,我自己在Databricks每天都会面对这个问题。我有法务部门,也有安全部门,他们几乎会对所有事情说:“慢一点。”而且不只是AI,任何事情都会这样。你要去上一个Podcast,他们会问:“脚本是什么?你要说什么?哪些可以说,哪些不能说?所有陈述是不是都在法律上准确?”

现在把这个逻辑放到强化学习实验上。你要训练下一代模型,运行数百万GPU小时,生成海量Token,让大量Agent在Sandbox里跑。如果安全团队要全程坐在那里,开着所有监控,盯着每一个环节,那当然会显著拖慢训练速度。

问题就在这里。实验室会说:“如果我们把这些安全流程全部加上,我们会慢很多,但我不知道竞争对手是不是也这么做。所以你们能不能进来给所有人加一些统一的安全边界?只要规则统一,我们很愿意遵守,也愿意把安全做好。”否则,从竞争角度看就不合理,因为你会被别人甩开。

Martin Casado: 我同意要做安全。但当大家真的已经非常害怕时,像“Pacing”这种带着很多二阶含义的词并不好用。你说“我们要Pace,所以这些事情就不会发生”,公众未必能理解。我觉得更清楚的说法就是:安全和网络安全是第一位的,我们会把必要的控制措施加进去。 这才是重点。

Sarah Wang: 这其实有点像Zuck的说法。你认同他吗?

Ali Ghodsi: 我觉得Zuck那套说法非常务实。

Sarah Wang: 他基本是在说:“我们会控制节奏,也会增加安全措施。这个模型为什么晚一点发布?因为我们在做安全。”

Martin Casado: 对。我觉得Zuck处理得很好,因为他一直把重点放在安全和自我监管上。Dario的开头则是“我们需要Pace the Frontier”。这两种表述会把人带进完全不同的心理状态。你完全可以说“把前沿系统做得更安全”,但“Pacing”这个词给人的感觉像是同时想讨好Doomer和政策制定者两边,最后反而谁都没满足。

Ali Ghodsi: 但你不觉得实验室内部确实有人真的害怕吗?而且不只是EA那一类人。很多Safety研究人员是真的被一些结果吓到了。

Martin Casado: 我相信他们是真的担心。但我仍然觉得,“Pacing”这个词并没有帮助他们。对Doomer来说,“Pacing”又不是暂停;对其他人来说,又会觉得“你们根本不会真的慢下来,而且你们好像还没有把安全说清楚”。所以我不是在争论到底该做什么,我只是说,这套公关表达方式本身就失败了,这也是为什么现在会出现这么大的反弹。

Ali Ghodsi: 这一点我同意。我的核心前提一直是:不要把公众吓坏。 我认为当前的存在性风险接近于零。但现在真正值得讨论的是另一件事——如果有人在做大规模强化学习训练,给系统一个可验证的奖励函数,然后一下子放出10,000个Agent,配上1亿美元预算,让它们在一个巨大的计算集群上连续跑一个月、两个月,不断尝试解决某个问题,那么真的可能发生很糟糕的事情。

而且不一定非得是“让它攻击系统”。你甚至可以只是让它解一道数学题、完成一个程序任务,但在这个过程中,它们可能会意外闯进不该进入的地方。在这些现实风险里,我认为Cyber是最主要的一个。

图片

如果AI真的开始自我改进,至少应该同时出现四个信号

Ali Ghodsi: 我觉得把现在发生的事情直接包装成“存在性风险”,是一个错误。这种表达方式只会把公众吓坏。现在全球各地很多原本完全不关心AI的人都会来问我:“你到底怎么看?这件事是不是已经非常严重了?我现在真的开始担心了。”当这件事进入公众层面以后,它自然就会变成政治议题——美国有选举,其他国家也一样,所以全世界的政治体系都不可能一直坐着不动。我们的责任应该是更平衡地谈这件事,把真正的风险讲清楚。至于Nick Bostrom在《Superintelligence》里描述的那种超级智能,我认为还非常、非常遥远。我现在看不到证据说明我们真的正在朝那个方向前进。

Martin Casado: 我也这么看。

Ali Ghodsi: 但显然,一些前沿实验室的人真的很担心。他们可能看到了某些我们外部不知道的进展。我猜这种担心很大程度来自RSI,也就是递归自我改进——模型开始帮助改进下一代模型。如果真的要判断RSI是不是正在发生,我觉得至少应该看四个条件。而且不是其中一个成立就够了,是四个必须同时成立。

第一,下一代模型需要的资源显著减少。 它需要更少的GPU、更少的算力,而且不是只减少一点,而是要以非常明显的速度持续下降。

第二,下一代模型训练所需要的时间也明显缩短。

第三,模型本身的能力和准确性还在持续提高。

第四,前面三件事必须能够一次又一次重复。 不是做成功一次,而是真的形成一个可以持续递归的循环。

Martin Casado: 也就是说,四个条件必须同时发生?

Ali Ghodsi: 对,全部同时发生,缺一个都不行。因为只要其中任何一个条件不成立,整个过程都会遇到现实世界里的瓶颈。比如,如果每一代模型需要的资源没有下降,哪怕其他东西都在进步也没关系,因为我们最终会把硬件用完。GPU不够,增长自然就会被限制。训练时间也是一样,只要时间没有持续缩短,它就没法无限加速。

所以如果你说的“自我改进”,只是软件开始自己写软件,那我们其实已经到了。Databricks现在90%以上的软件都已经由AI帮助编写。 但最后剩下那几个百分点是不是也由AI来写,真的会让世界发生质变吗?我不这么认为。

真正让我开始担心的是另一种情况:假设下一代模型只需要一半训练时间、一半计算资源,同时能力还更强;然后再下一代又继续减半,而且这个过程可以持续重复。那你确实可能进入一个完全不同的动态系统。

不过我要强调,即使四个条件都成立,我也不确定它就一定会收敛到“超级智能”。 它也可能最终在某个地方收敛。但如果真的看到这种模式出现,风险显然会比今天高得多。所以我希望实验室能够把相关数据公开出来,让外界真正看到他们到底发现了什么。

Martin Casado: 我觉得你这个拆法其实非常好。

Ali Ghodsi: 我甚至不觉得行业现在真的在用这种方式定义RSI。很多人看到所谓“涌现行为(Emergent Behavior)”,看到模型开始写自己的代码,就会说:“天哪,它已经开始创造自己了。”但这里其实混淆了两件完全不同的事情。

一件事是:“我的工作价值是不是正在下降?AI是不是已经能替代我写代码?”

另一件事是:“这是不是意味着我们正在走向Bostrom在2014年理论上描述的超级智能?”

这两者之间差得非常远。

Sarah Wang: 我觉得你关于算力的那一点特别重要,因为很多讨论RSI的人其实忽略了这个问题。到目前为止,我们看到的恰恰是:训练一个优秀前沿模型所需的最低算力门槛一直在往上走。过去可能是1亿美元、10亿美元,现在训练一个真正的Frontier Model,可能已经要到50亿甚至100亿美元这个量级。

Ali Ghodsi: 对,前沿模型现在非常昂贵。

Martin Casado: 但有一个有意思的现象:如果你想在六个月之后复现今天的Frontier,成本可能只有原来的二十分之一。

Ali Ghodsi: 但Sarah刚才那一点仍然是一个很强的反证。因为如果我们真的正在进入我刚才说的那种RSI循环,现实应该越来越接近那四个条件;但今天看到的情况恰恰相反。

这些实验室一年可能也就真正做一两次这种级别的前沿训练,而且下一代模型需要更多资源、更多人、更复杂的数据中心。 你必须准备更大的GPU集群、更复杂的网络,还要解决规模扩张以后以前根本不会出现的故障问题。GPU数量每扩大一个数量级,系统里的错误和故障模式都会发生变化,所以你必须不断增强整个训练基础设施的稳定性和容错能力。而且整个过程极其脆弱。一旦一次训练失败,你可能就浪费掉巨额资金,所以实验室在真正的大规模训练上其实会非常谨慎。过去也确实发生过一些训练任务被搞砸的情况。

所以这和“下一代模型变得更快、更便宜、更聪明,然后继续自我改进”的图景完全相反。今天的现实是:模型训练越来越慢、越来越贵、需要更多人,而且越来越难成功完成。

从RSI这个角度,我觉得这确实是一个非常重要的事实。但如果我们谈的不是RSI,而是Cyber风险——系统被攻击、Agent找到漏洞、基础设施被入侵——那是另一回事。

Martin Casado: 那个风险非常高。

Ali Ghodsi: 对。Cyber风险必须非常认真地对待。它和“超级智能是不是马上要来了”,根本不是同一个问题。

图片

判断RSI不能靠感觉:如果它真的发生,实验室应该开始变得更小、更快、更省

Martin Casado: 我再给一个更偏“黑箱”的测试。面对这种动态、自适应系统,我们到底应该相信什么?我觉得最后还是得回到那些真正能从外部观察到的数据。如果这些AI公司继续增长,但训练下一代模型所需要的人越来越少、投入的钱越来越少,模型发布速度却越来越快,那我会开始觉得,这里可能真的发生了某种根本性的变化。比如,如果Anthropic两周后只剩12个人,却还能不断以更高频率推出更强模型,那当然值得高度警惕。但现在看到的不是这样,它们还在疯狂招人,也还在疯狂烧钱。

Ali Ghodsi: 我理解这个思路,但我觉得直接看“整个公司有多少人”还不够公平,因为公司本身未必高效。OpenAI过去也同时做很多不同的事情,真正做LLM的核心团队可能只是其中很小一部分;Twitter过去人很多,后来大幅缩减,也不能据此说它发生了什么递归自我改进。所以真正该看的,是负责Pre-training和Post-training、真正训练下一代模型的那支核心团队:他们是不是越来越小?需要做的人工工作是不是越来越少?是不是越来越多事情已经由AI自己完成?与此同时,他们使用的GPU是不是也在持续下降?如果这些现象同时出现,那才有意义,但目前并不是这样。

Martin Casado: 对,所以我们其实可以有两个测试。一个是你刚才那套严格的四条件测试,但它需要实验室内部数据;另一个就是外部的黑箱测试,看人力、资本和模型发布节奏。科技行业以前其实经历过很多类似争论。比如我们真正学会大规模Cluster计算以后,Mainframe受到内存一致性等问题限制,没办法无限做大,后来进入Client-server时代,再后来又把大量普通机器组成Supercomputer,GPU也越来越强。那个年代甚至一度有人担心PlayStation之类的消费设备可能被组合起来做高性能模拟,甚至用于核武器相关计算,所以出现了出口限制。那时候的逻辑其实和今天有点相似:计算能力越来越强,会不会带来极端风险?但很多当时最夸张的担忧最后并没有兑现。所以真正合理的问题是:这一次到底是不是不一样?

Ali Ghodsi: 我得承认,我对你说的PlayStation出口限制没什么印象,也许是因为我那时候在瑞典,或者只是年纪大了以后失忆了。但不管怎样,我确实认为今天的规模和30年前不同。AI的发展速度、全球互联网基础设施的规模、系统之间的依赖程度都完全不一样了。今天世界上有太多基础设施本身就不安全,而我们又把越来越多系统连接到一起。如果你把大量Agent释放出去,它们会找到漏洞、找到Exploit,也会闯进各种系统。你甚至可以想象更极端一点的场景:某个Agent获得了资源以后,开始把自己部署到其他机器上继续运行,再从那里往别处扩散,行为上有一点像病毒。这不是“超级智能已经出现”,但它确实是一种非常现实的系统性风险。

图片

真正迫近的不是AI末日,而是Cyber攻防进入机器速度

Martin Casado: 那我纯粹出于好奇问一个问题,不是故意唱反调:如果Cyber风险真的这么高,为什么我们到现在反而还没看到特别多灾难性的事情?我比你老一点,所以我很清楚记得互联网早期是什么样。互联网刚起来没多久,我们就见过Worm让大量系统瘫痪,医院和关键基础设施受到影响,经济损失达到数百亿美元。那时候整个经济对互联网的依赖远没有今天这么高。可AI现在已经吸引了这么多钱、这么多安全研究者、这么多人主动寻找风险,而且行业还跑得这么快,我们却还没有看到一个和互联网早期Worm时代规模相当的AI网络灾难。这个差异到底怎么解释?

Ali Ghodsi: 我确实记得那个时代,而且我现在晚上睡得很好。我不认为眼下存在什么迫近的AI存在性风险,但我确实认为有大量基础设施需要被重新加固。 Databricks现在也进入了Detection市场,我们有一个产品叫Lakewatch。过去企业会依靠SOC,也就是Security Operations Center,由一群安全人员每天分析入侵、告警和异常行为,但现在最现实的问题是,人类已经跟不上攻击发生的速度了。所以整个Cyber行业正在被迫转向自动化:攻击端越来越多地使用Agent,防御端也必须用Agent做Detection。如果做不到这一点,接下来一定会看到更多网站瘫痪、系统中断、经济损失,甚至真实的人身伤害。它们未必是存在性灾难,但后果仍然会很严重。

现在很多组织的现实状态其实相当落后。安全团队每天早上可能面对几百条告警,其中大部分是假阳性,但真正危险的攻击也混在里面,人根本没时间逐条看完。所以Detection必须自动化,Threat Hunting也必须自动化,甚至应该让Agent持续主动攻击自己的系统,提前寻找漏洞,而不是等攻击者先找到。银行和那些安全意识特别强的机构正在这样做,但绝大多数企业今天仍然依赖非常传统的SOC模式。 如果我们只是说“这和互联网早期一样,反正最后都会解决”,那我觉得坏事一定会发生,这里确实存在一场Race。

Martin Casado: 这其实让我今天早上很惊讶。我一直觉得自己对Databricks了解不少,但今天早上我和一家创业公司的Founder通话,他告诉我,他们在做Observability、Agent Threat Detection之类的东西,而且整个系统就是跑在Databricks上的。我当时甚至不知道你们已经进入这些领域这么深。所以纯粹从科普角度讲,Databricks现在在Agent、Observability、Security和Safety这些方向到底做到什么程度了?

Ali Ghodsi: 我们今年其实在RSA讲过这件事,当时还和Ben Horowitz一起做了一场Talk。我越来越强烈的判断是,Data / AI和Cyber这两个市场正在融合。 过去它们是分开的:Data和AI这一边,像Databricks这样的公司帮助企业收集数据、跑Machine Learning、做分析;Cyber则负责检测坏人有没有攻击你、系统里有没有异常行为。但现在企业内部开始有大量Agent运行,员工在跑Agent,Agent之间还会互相交互,甚至和外部Agent协作,整个过程会产生海量Logs、Trails和各种行为痕迹,这些都必须被分析,而且规模比一两年前高出很多个数量级。所以Data / AI和Cyber其实正在被同一个问题拉到一起:如何实时理解机器产生的大规模行为数据。

变化到底有多快?大概在2018、2019年,一个CVE,也就是公开披露的软件漏洞,从被公布到真正被攻击者Weaponize,可能要两三年;到2022年前后,这个周期已经缩短到八九个月;但从2022到现在,这条曲线继续快速往下掉,很多漏洞从公开到被真正利用,可能已经只剩几个小时。这意味着你几乎没有人工反应时间,所以这件事只能越来越自动化,而一旦自动化,Data、AI和Cyber平台自然就会融合。我认为这几个市场最终很可能直接合并。

Martin Casado: 这正好把我们拉回前面关于存在性风险的争论。我感觉现在大概有两个阵营:一个阵营认为,这本质上是一个Engineering Problem,像Databricks这样的公司可以通过产品、工程和服务把它解决掉;另一个阵营则认为,没有工程解法,这类风险更像核武器,所以必须让整个行业减速,甚至依靠监管。那你的判断到底是哪一种?你认为AI风险最终是可以被工程解决的问题吗?

Ali Ghodsi: 我觉得这里其实混在一起了两个完全不同的问题。第一种,是Superintelligence。很多相关讨论都可以追溯到Bostrom 2014年的《Superintelligence》。如果真的按照那本书里的定义来理解超级智能,那东西和今天的Agent完全不是一个量级。Bostrom想象的可能是一种AI,可以在几秒钟内写出一整篇真正具有新知识、能够通过同行评审的博士论文,可以瞬间完成相当于人类几千年甚至更长时间的思考,甚至能直觉式处理人根本无法理解的高维物理问题。也就是说,它不是“比人类会写代码一点”,而是在速度和智能水平上高出很多、很多个数量级。 如果真的出现这样的东西,我不会说“这只是一个工程问题”,那确实可能成为存在性问题。

但现在的问题是,大家把这个概念和今天已经存在的Agent混在了一起。今天的Agent离那种Superintelligence还远得惊人,我们没有看到那种东西,也没有看到明确证据说明已经走上通往它的道路。但与此同时,今天的Agent又确实足够有能力,让我们第一次能做一些人类历史上从来做不到的事情。比如Databricks有很好的Security Researcher,但过去我不可能说:“我们现在找10,000个安全研究员,把他们全放进Sandbox里,让他们连续工作一个月,完成价值1亿美元的人力劳动。”现在你可以做到,甚至可以一键启动100,000个Agent。数学也一样,你可以让10,000个Agent协作去攻一个Conjecture。

Cyber风险很大程度就来自这种能力:不是单个Agent突然变成了超级智能,而是你第一次可以把相当不错的认知劳动复制10,000次、100,000次。 这一类问题,我认为是可以通过Engineering解决的;真正仍然不确定的,是实验室正在研究的RSI会不会最终把我们带到Superintelligence。

一些实验室已经提出,可以让外部Inspector进入实验室,看它们到底在做什么、RSI进展到了哪里。我觉得这是个好主意,但真正关键的问题是:Inspector到底应该是谁? 你不能找一个在进去之前就已经决定答案的人。不管他原本属于哪个阵营,如果他早就坚信“AI一定会毁灭世界”,或者坚信“这一切都是胡扯”,那他出来以后给出的结论价值都有限。比如Yann LeCun长期对Superintelligence风险非常怀疑,如果让他真的进入实验室、看完内部数据以后,出来仍然说“这里没什么值得担心的”,那我会非常安心;反过来,如果他出来以后明显改变了态度,那也会是一个非常强的信号。所以我支持第三方检查,但最好是一组观点真正多元的人。

图片

谁来监督前沿实验室?真正困难的不是要不要监管,而是谁有资格判断风险

Martin Casado: 那Elon Musk提的那种方式呢?现在大概有三种方案:OpenAI和Anthropic更倾向第三方检查;Elon更像是在说实验室互相检查,类似科学里的Peer Review;Zuckerberg则更偏向Self-regulation。你怎么看中间这种“实验室互相审查”的模式?

Ali Ghodsi: 如果两个人在拳击台上比赛,让两个拳击手互相当裁判,你觉得会怎么样?比赛一开始,他们肯定都会不断喊:“犯规!犯规!”只要竞争对手发布了一个特别好的模型,另一家公司就完全有动力说:“这个模型存在巨大的Superintelligence风险,他们太不负责任了。”这些公司之间有非常强的竞争,背后还有IPO计划、资本利益和过去积累的历史关系,你很难指望它们完全公平地评价彼此。

这就是为什么我们需要真正的第三方。 当然,它们如果愿意互相Review,我完全支持它们尝试,但我会对其中不可避免的Bias保持非常谨慎。

Sarah Wang: 我还是得问一个问题。Elon之前在All-In Summit上说过,这可能是一场非常复杂的“4D Chess”:一方面,有些实验室在说“AI可能毁灭全人类”;另一方面,它们又在问投资人:“那你想拿多少IPO allocation?”这两件事放在一起,很多人会觉得非常割裂。你怎么看这种矛盾?

Ali Ghodsi: 我觉得这些事情确实会混在一起。一方面,我相信有些人是真的被吓到了,他们真正担心前沿模型可能带来严重风险;另一方面,也一定有人会觉得,如果出现某种监管,能够让整个行业统一放慢一点,对自己其实是有利的,因为这样竞争对手也会一起受到约束。与此同时,每个人又都有自己的既得利益。

人往往很擅长把这些不同动机在自己脑子里解释成一个彼此协调的故事。所以,过去行业里确实出现过一种倾向:每训练出一个新模型,就说“这个模型太强了,强到连我自己都有点害怕”,然后全世界的注意力都会被吸引过来。

这种叙事当然有真实风险作为基础,但它同时也可能成为一种非常有效的营销手段。 我前面说过,CVE从公开披露到被真正武器化,已经从过去的几年缩短到今天的小时甚至分钟级,Cyber风险完全是真实的;但另一方面,一个新模型发布时,如果你不断强调“它可能改变世界,甚至危险到令人恐惧”,显然也会帮助你获得更多关注。这两件事并不一定互相矛盾。

Martin Casado: 你我都是做Networking出身的,这个行业其实有很长的第三方协调传统,比如IETF、IEEE,甚至ICANN。你刚才也说过,不能让拳击手自己给自己当裁判。所以我其实觉得,让一个独立的第三方进入实验室做检查,是一个非常合理的方案。但这就会引出另一个问题:第三方行业机构和真正的政府监管其实不是一回事。那你觉得,什么时候应该让联邦政府真正介入?现在已经到了那个阶段,还是仍然应该优先依靠行业自律?

Ali Ghodsi: 我觉得这两种模式最终很可能会逐渐融合。现实里很多监管结构本来就不是完全二元的,比如FINRA名义上有很强的行业自律属性,但它又和政府监管体系紧密相连。

AI最后很可能也会沿着类似方向演化。更现实的一点是,如果这些实验室自己不断告诉政府:“这里存在存在性风险,请来监管我们”,那监管者其实很难永远回答:“不用,我们不准备管。”到目前为止,政府相对克制,但我不觉得这种状态会长期持续。

Martin刚才开玩笑说,有政府官员感慨“以前从没见过CEO主动来要求监管自己”;反过来,CEO可能也会觉得:“我还没见过监管者会一直拒绝这样的邀请。”一旦整个政治系统已经开始围绕AI形成议题,这件事很难再完全退回纯粹的行业自律。

Martin Casado: 这也是我担心的地方。现在相关政治机器其实已经转起来了,各方都有自己的Talking Point,AI也正在进入越来越主流的政治议程。有没有可能我们其实已经过了那个拐点,最后会走向一种非常强硬的联邦监管,甚至把整个行业真正按下暂停键?还是说,我们依然有机会形成一种更合理的自我监管和外部监管组合?

Ali Ghodsi: 我觉得现在仍然有选择空间,也还有时间把事情做对。问题在于,我们现在向这些公司投入了极其庞大的资本,而强化学习的机制又很容易让人产生一种错觉:你给模型一个可以验证的奖励函数,比如解一道数学题、完成某类编程任务,然后往里面投入海量计算资源,它确实可能在那个狭窄领域里表现得非常好。但这并不等于你获得了Superintelligence,更不意味着RSI已经发生。

Martin说得很对,如果你做了太多实验、投入了太多资源,有时候甚至会误以为自己“用更少输入得到了更好结果”,但实际上整个系统的真实成本仍然非常高。Sarah刚才也提到,这些公司的融资规模还在急剧上升,而这恰恰说明它们仍然高度依赖资本和算力。

如果递归自我改进真的已经形成,我们理论上应该看到模型越来越不依赖资本;但现实里,这些实验室恰恰需要越来越多的钱。 这也是为什么很多公司最终会选择上市——如果不需要这么多资本,我猜它们反而会更愿意保持私有状态。它们之所以需要公开市场,是因为Scaling Laws和资本投入本身仍然被视为竞争优势。

所以我还是想回到前面那四个条件。如果那四件事真的同时发生:下一代模型需要更少资源、更少时间,能力还更强,而且这种过程可以不断重复——你当然会想知道,而且那确实值得担忧。问题是,现在没有证据证明这四件事正在同时发生。

Martin提到,技术史上其实早就存在很多“自催化”现象:我们用计算机设计新的计算机,用编译器编译新的编译器,用AI清洗训练数据、优化GPU Kernel,互联网本身也因为让人们可以远程协作而加速了下一代互联网的发展。但这些都不等于真正意义上的RSI。大量公司今天说自己在做RSI,实际做的往往只是“让AI帮助加速原本就存在的研发流程”。这种自催化当然重要,但它在人类技术史上并不新鲜。真正值得观察的是另一件事:模型是否真的开始承担训练下一代模型本身的核心工作,并由此形成可重复的自我加速循环。 现在确实已经有团队在探索这件事,但规模远没有外界想象得那么大。

Sarah Wang: 但Greg Brockman这周刚上节目说,我们已经进入“AGI时代”了。

Ali Ghodsi: 对,所以每次有人这么说,我都会回到同一个问题。过去很长一段时间,很多人都在告诉我:“AI现在大多数时候已经比我身边的大多数人更聪明了。”大概从去年第三、第四季度开始,我就不断听到这种说法。那我就问他们:好,如果AI已经这么聪明了,你们现在有多少人真的在管理几百、几千个Agent?这些Agent会互相协调、组成Swarm、彼此谈判,并且真正自动化你身边的工作和生活吗?如果有,请举手。结果几乎没人举手。当然,Martin可能已经在自己家里这么做了。

但企业就更明显了——Sarah说得很准确,很多公司所谓的AI应用,基本就是Microsoft Copilot。你再往下问:“那到底在做什么?”答案通常只是Chatbot,最多就是一个效率更高的Google Search,再加上Coding。真正由Agent端到端自动化整个企业工作流的情况,基本还没有发生。 

图片

企业真正缺的不是更聪明的模型,而是让AI理解“这家公司到底怎么运转”

Ali Ghodsi: 那为什么没有发生?我认为真正的原因其实很简单:模型已经足够聪明,但它没有企业内部的上下文。 它没有参加过每一次会议,不知道每个人脑子里掌握的隐性知识,也不了解那些没有被写进正式流程里的真实工作方式。

几乎每家公司里都有那么几个员工,大家会说:“如果他或者她离职了,我们怎么办?”因为这个人知道所有历史、所有例外、所有内部关系,也知道事情真正应该怎么推进。今天的AI缺的恰恰就是这种Context。如果你能够把这些上下文真正注入现有的Frontier Model,我认为地球上几乎任何组织都还能获得巨大的生产率提升。

为了做到这一点,我们其实不需要模型先解决Navier-Stokes方程,也不需要它在Humanity’s Last Exam上再提高多少分。对绝大多数企业来说,模型从“足够聪明”继续变成“更聪明”,并不是当前最大的瓶颈。

所以我觉得外界现在有点把注意力放错地方了。有人会说,如果我们“放慢Frontier”,创新就会受到巨大伤害。但对于地球上绝大多数组织来说,就算Frontier暂时不再前进,其实也不会产生那么大的影响,因为它们在AI Adoption Curve上还落后得太远。它们还没有真正把今天已经存在的能力转化成自动化和业务价值。

真正应该讨论的是成本收益:我们前面谈了很多AI的成本——存在性风险、Cyber风险、各种安全问题——那收益是什么?现在AI已经变成一个全民议题,公众自然会问:“这件事对我到底有什么好处?我得到了什么?”如果普通人最后得到的答案只是“模型Benchmark又提高了几分”,那显然是不够的。

Sarah Wang: 那企业到底怎么真正获得这些收益?你们现在看到过哪些Use Case,是连你自己都觉得比预期更有价值的?

Ali Ghodsi: 其实有很多,只是因为现在大家天天都在谈存在性风险,反而很少有人知道AI已经在做哪些真正有意思的事情。比如Crisis Text Line,他们会和我们一起用大语言模型识别青少年是否存在自残或自杀风险。这个系统是真的可以帮助挽救生命,我觉得这是非常好的Use Case。

另一个例子是Omnipod,它面向糖尿病患者,可以用AI持续学习一个人的血糖水平和胰岛素释放规律,然后更自动地调节胰岛素。过去很多人需要自己不断扎针、手动处理,现在越来越多过程可以自动完成,相当于针对每个人身体状态进行持续学习。Zipline也是类似的例子,它从一开始就在大量依赖自动化和AI,从电池优化到路径规划,再到无人机调度,用于向医疗和物资短缺地区配送血液和其他关键物资。这些都是非常具体、非常现实的价值。

还有一些Use Case技术上更复杂。比如我们和Merck一起做了一个叫TEDDY的Transformer模型,全称是Transformer Enhanced Drug Discovery。传统语言模型预测的是“下一个Token”,而TEDDY预测的是基因调控网络接下来会如何响应,它希望区分哪些细胞变化真正具有因果作用,哪些只是被动反应。这样就可以进一步服务药物发现,更精准地寻找针对特定疾病的候选机制,并降低研发成本。这个研究他们已经公开发表了。

Novo Nordisk也在使用Genie,把它用于临床试验数据分析。比如做一项肥胖症研究,过去从数据中得到洞察可能需要几周,现在可以把这个周期压缩到分钟级。所以AI的收益端其实已经非常丰富,只不过公众叙事长期被“它会不会毁灭世界”占据了。我们当然需要讨论风险,但也不能忘记,这些恰恰是我们不希望被一起“放慢”的东西。

Sarah Wang: 那如果把时间拉到未来12个月,企业到底应该怎么真正把AI Operationalize?你刚才提到了Context,但具体要怎么做?

Ali Ghodsi: 这件事其实比大多数人想象的难。第一步不是再换一个更强模型,而是先把组织里发生的事情真正数字化。 每一次会议都要能够被转写,每一段重要沟通、每一个数字内容、每一套流程都要尽可能进入可以被AI理解的系统。你不能挥一下魔法棒,就让模型突然知道过去几年公司到底发生了什么。首先必须把这些信息收集起来,然后把它们组织成一个能够表达公司内部关系的结构,我们把这个叫Ontology。

但仅仅“收集”本身就已经很困难。比如法务团队可能会说:“不要录下每一通电话,也不要把所有会议都永久保存。”这就意味着企业必须同时处理隐私、权限、合规和数据治理问题。只有在这些基础工作完成之后,你才有可能真正建立一个属于这个组织自己的上下文层。也正因为如此,企业AI真正的挑战并不是“模型够不够聪明”,而是一个组织能不能把自己长期积累、原本散落在人脑、会议、文档和流程里的知识,转化成AI能够持续理解和调用的结构。

Sarah Wang: 你能不能解释一下Ontology到底是什么?因为Palantir经常讲这个词,但它显然也不是Palantir自己发明或者拥有的概念。对于普通听众来说,应该怎么理解?

Ali Ghodsi: Ontology说到底,就是一个组织内部所有抽象概念之间的关系。公司的目标是什么?有哪些部门?有哪些人?有哪些项目正在推进?这些项目分别意味着什么?人、资源、目标、流程以及公司真正做的事情之间,到底是什么关系?你可以把它理解成一个人对这家公司“究竟如何运转”的完整认知。

最直观的例子,就是比较两个能力完全相同的人。假设两个人受教育背景一样,智力、努力程度也一样,其中一个今天是入职第一天,另一个已经在公司工作了五年。他们真正的差别是什么?差别不是智力,而是后者已经拥有这家公司的Ontology。 她知道这个组织实际上怎么工作,知道每个人是谁,知道事情真正应该找谁推进,也知道什么时候不能只看Org Chart。所谓企业AI真正缺失的Context,本质上就是这种只有长期身处组织内部才能逐渐形成的认知结构。

图片

Ontology真正解决的,是把“只有老员工知道的公司知识”变成AI可以调用的组织记忆

Ali Ghodsi: 这就是为什么企业里的Ontology这么重要。你不能只看组织架构图,真正把事情做成,往往靠的是那些从来没有被正式写下来的知识:这个人不要去找,找了也推进不动;那个人虽然职位不高,但真正能把事情办成;这个流程看起来需要填表,其实在某种情况下根本不用;某个项目表面上已经结束了,但实际上还有另一条隐性的推进路径。

一个人在公司工作五年以后,脑子里会积累大量这种信息。也正因为如此,创业公司里经常会说,如果一下子失去大部分员工,公司不是简单再招一批新人就能恢复,因为真正丢掉的是那些沉淀在人脑里的Context。Ontology要做的,就是把这种“组织是如何真正运转的”从人的经验里抽出来,变成AI可以理解和调用的结构。

但光把会议录下来、把文档收集起来还不够,第二步是把这些信息进一步压缩、组织成一张可以被机器高效查询的数字关系图。今天很多Agent——无论是Claude Code、Codex、Pi还是OpenCode——本质上都会进入一个Agent Loop:先思考,再一个资源一个资源地去查,访问一个MCP Server,看答案是不是在那里;如果不是,再去找下一个,然后把零散信息拼起来给你答案。这种方式能工作,但会非常慢,也非常贵,而且质量还不稳定。

我经常拿Google Search来类比。如果25年前Google是按照今天很多Agent的方式做搜索,它收到你的关键词以后,不会直接给你十条结果,而是先随机访问一个网站,用模型总结一遍,再顺着几个链接跳到其他网站,继续读、继续总结,跑上十分钟,最后告诉你:“这是我大概找到的十个结果。”那会有三个问题:第一,每次搜索都要重新访问大量网站,成本高得惊人;第二,你得等十分钟;第三,它实际上只看到了整个互联网里很小的一部分,所以结果质量也不会好。Google真正解决这个问题的方法,是提前把整个Web构建成Index。你搜索时根本不用离开Google服务器,查询直接命中索引,100毫秒以内就能把结果给你。

企业AI也需要同样的东西。Ontology本质上就是要持续在后台预计算这张“组织索引”。它有点像当年的PageRank,但企业环境比开放互联网复杂得多,因为这里不仅有链接,还有权限、隐私和访问控制。你能看的数据,我未必能看;同一个组织里还存在员工、项目、客户、会议、文档、指标、流程等完全不同类型的对象。问题确实更难,但并不是不能解决。

如果这张组织级索引能够建起来,AI就不必每次从头在公司里“到处找资料”,而是可以直接从已经结构化好的组织知识中获得上下文。

Sarah Wang: 而且你们其实已经在Databricks内部这么做了。

Ali Ghodsi: 对,我们自己就是最重度的Databricks用户。我们内部这张Ontology可能比任何一个客户现在建立的都大,里面已经有数以百万计的节点。

过去一年左右,公司内部的工作方式因此发生了很大的变化。传统组织本质上是一棵树:信息沿着管理层级向上汇报,某个人做不了决定,就交给老板;老板如果还不能解决,再继续往上。每升一级,新的决策者都要先花时间重新理解Context。决定做完以后,又要沿着组织层级逐级向下传达。大量管理工作,其实就是在不断同步上下文。

一旦你有了Ontology,其中很大一部分就可以被AI接过去。想想一场典型会议:有人先花时间做分析,用Excel建模型,再做成PowerPoint,画几张漂亮的图,然后所有人坐下来听;会上有人提出问题,发现还缺数据,于是再安排一次Follow-up Meeting。现在AI可以直接完成很多分析,因为它已经拥有整个组织的上下文;它可以按照你需要的方式呈现结果,你也可以当场追问,而不必为了一个新问题再等下一场会议。

Jack Dorsey过去谈过AI如何改变组织结构,我觉得Ontology给出的是一个非常具体的实现方式。对Databricks来说,这已经不是理论了——现在很多会议里,只要有人说了一个比较复杂的问题,大家几乎都会低头打开手机去问Genie。

Sarah Wang: 你之前还讲过一个Finance的故事,我特别喜欢。能不能再讲一次?

Ali Ghodsi:有一次我要准备一个内部Presentation,需要知道Databricks在Fortune 500里的客户渗透率。我先去问Sales Ops里一个人,因为我以为她手里会有一个权威数字。结果她回我说:“不好意思,我现在在飞机上,登不上Genie。”我当时就有点生气,因为我心想:如果你也是准备去Genie里查,那我自己也会查啊。我之所以问你,是因为我以为你掌握了一些我没有的信息。于是我又去问CFO Dave:“你知道我们的Fortune 500渗透率是多少吗?”结果他什么都没解释,直接给我发了一张Genie的截图。

我当时就在想:“这里还有没有人在做什么真正新的事情?是不是所有人现在都只是在问Genie?”后来公司里甚至形成了一句话,不再是“Let me Google that for you”,而是“Can someone just Genie this?”。这件事最有意思的地方,不是AI替代了搜索,而是它正在变成企业内部获取权威组织知识的默认入口。

当然,这并不是按一个按钮就自动拥有Ontology。Palantir有一点我觉得做得很好,就是它会深入组织,把大量原本存在于人脑里的Tacit Knowledge真正写下来。我们在这个基础上进一步自动生成关系图,再把这张图喂给Agent,让它不仅能回答问题,还能以业务领导真正需要的方式呈现答案:有图表、有分析,可以继续追问,可以围绕一个问题不断展开,最后还能把结论重新传播到整个组织里。

所以真正的企业AI不是“让员工多一个Chatbot”,而是建立一套可以持续积累、查询和传播组织记忆的基础设施。

图片

从“Token越多越好”到“每一美元都要创造价值”,企业AI开始进入成本治理阶段

Sarah Wang: 你前面提到开发者大量使用AI,但ROI未必总是清楚。我还想追问一下Databricks自己的经历。你们算是很早就鼓励员工大量使用AI的一家公司。虽然我不太想用“Token Maxing”这个词,因为现在听起来有点负面,但你们确实很早就在奖励那些会用AI提高生产率的人。

后来行业很快又出现另一个阶段:大家发现Token烧得太快,于是从“Token Maxing”转向“Value Maxing”。你们是怎么经历这个过程的?Unity Gateway在这里又起了什么作用?

Ali Ghodsi: 大概从去年第四季度开始,我们明显感觉模型能力跨过了一个点,真的开始产生很强的生产力收益。我甚至自己开始用模型写代码,并且真的把代码Commit进Databricks的Production。我就是故意想把这件事推到最极端:如果CEO都可以在一个安全要求这么高、承载大量敏感数据的平台上直接把AI写的代码推到生产环境,那其他经理和工程师为什么不能?所以我开始非常强硬地推动整个组织使用AI,还做了Leaderboard。到今年一二月份,大家已经全面开始用了。

但很快,二三月份的时候,行业里的“Token Maxing”也开始失控。好在我们比很多公司早了几个季度看到这个问题。当时Databricks已经有Unity Gateway,它本来就可以统一提供OpenAI、Anthropic、Gemini、Groq以及各种开源模型的调用能力。于是我们开始在Gateway里做预算治理:给每个人、每个团队设Budget,快到上限时就提醒;再进一步做成本分析,预测钱到底会花到哪里。

之后我们又加入了Smart Router。如果一个任务很简单,或者某个团队已经快用完预算,就自动切换到更便宜的模型。我们还做了一个叫Omniagent的Harness,可以在不同Agent Harness之间动态切换。

这里有一个很容易被忽略的事实:即使底层用的是完全相同的模型,不同Harness也可能带来接近2倍的成本差异。 同一个模型、同一个版本,只是换了一套Agent运行框架,Token消耗和实际成本就可能完全不同。所以成本治理不能只盯着模型价格,Harness本身也非常重要。

这些手段叠加以后,我们基本把AI成本曲线压住了:Token使用量还在持续上涨,但总体费用大致保持平稳。我认为这件事现在几乎每家公司都会遇到。企业真正开始大规模使用AI以后,很快就会从“大家快点用”进入下一阶段——不是最大化Token,而是最大化每一美元带来的业务价值。

Martin Casado: 我最近第一次在一家已经有相当规模的公司董事会上听到,他们准备从Frontier Model转向GLM,而且还是一家大型工程组织。我越来越多地听到这种例子。之前DeepSeek第一次出来时,市场反应非常剧烈,甚至一度影响Nvidia股价,但后来好像并没有真正改变模型使用格局;后面又有Kimi、新一轮DeepSeek,似乎也没有产生决定性变化。但现在这些真实案例越来越多。你觉得这是趋势吗?

Ali Ghodsi: 我觉得大家最终都会同时需要两类模型。真正困难、ROI很高的任务,当然愿意用最新、最聪明的Frontier Model;但企业里还有海量极其普通的任务。有人甚至会让Agent帮自己改文件名——这种事情如果也调用最贵的模型,让它思考五分钟再替你Rename File,那完全没有意义,你自己手动改可能更快、更便宜。

所以市场确实在动。越来越多公司开始采用类似“专家组合”的模式:一个小而便宜的开源模型负责大部分普通任务,遇到真正困难的问题再调用更大的Expert Model;也可以反过来,让不同模型互相检查,或者在不同Harness之间切换来控制成本。

模型本身又具有随机性,同一个问题每次回答都可能不一样,而且版本变化极快,所以行业还在大量实验。未来不会再是“新模型一出来,因为它最聪明,所以所有任务全部换成它”。企业会开始根据任务难度、延迟、成本和准确率动态选择模型。

Martin Casado: 我现在看到的一种模式是,用更强的模型做Architecture,用便宜模型做Implementation,最后再让强模型做Audit。

Ali Ghodsi: 对,我很好奇你们在Startup里看到多少开源模型。

Martin Casado: 如果按美元算,开源可能只有5%左右,非常少;但如果按Token数量算,已经超过60%。

Sarah Wang: 产品侧甚至可能更高。比如一些做客服Agent的公司,面向客户的生产环境可能已经接近90%开源;但公司内部反而会觉得“成本先不管,直接上Frontier”。只是随着规模越来越大,这种浪费也开始被认真处理。

Ali Ghodsi: 这和我看到的很一致。因为大量高频、重复、边界明确的任务非常适合开源模型,而少数真正困难的问题再交给Frontier Model。最后形成的不是“开源替代闭源”,也不是“Frontier吃掉一切”,而是一套多模型共同工作的架构。

Sarah Wang: 这也正好引出Post-training。你们2023年收购Mosaic的时候就一直在讲,企业最终会拥有自己的Intelligence。当时听起来还比较早,但到2026年,Startup确实已经越来越多地在开源模型上自己做Post-training。你觉得当时是判断得太早了吗?

Ali Ghodsi: 当时有一部分判断确实需要修正。比如过去我们也会说“企业可以自己做Pre-training”,现在看来没必要了,因为市场上已经有很多非常优秀的Pre-trained Model,绝大多数企业完全没必要从头训练基础模型。但Post-training不一样。你可以拿一个很好的开源模型,再通过Reinforcement Learning把它训练成非常擅长某一个具体任务的模型。很多Startup现在就在这么做,而且其中不少就是我们的客户。我们会提供强化学习环境,让它们针对自己的具体业务不断优化模型。

如果你是一家Startup,产品本身就是不断重复某一种具体任务,而不是提供“通用智能”,那这条路非常合理:你可以把成本打下来,把速度做得更快,而且模型和相关知识产权都掌握在自己手里。对垂直AI公司来说,Post-training正在变成建立产品差异化的一种现实手段。但大型企业不是这样。很多大公司现在连最基本的自动化都还没有真正做起来,再让它们建立一整套自己的模型训练体系,往往太复杂了。

真正难的地方其实是Eval。大家很容易说“我要自己训练模型”,但你必须先知道“什么叫训练得更好了”。你要建立一套高质量评测,有Baseline,有清晰指标,然后每次迭代都科学地比较结果。

Startup通常有足够强的动机做这件事,因为这就是它的核心产品;但普通企业往往只想尽快解决问题。我们甚至曾经在产品里自动帮客户生成Eval,还把它放在非常显眼的位置,结果很多人根本不想用;后来我们把它移到后台变成可选功能,用户就更不会去碰了。

这其实很像软件工程里的Test-driven Development。大家都知道先写测试、再写代码是一种很规范的方法,也都承认理论上应该这么做,但现实里真正长期严格坚持的人非常少。Eval也是一样。Post-training最难的部分不是“把模型再训练一遍”,而是先建立一套可信的方法,证明它真的变好了。 这也是为什么对很多企业来说,直接调用一个Frontier Model反而仍然是最简单的“Easy Button”。

图片

当“用户”变成Agent,基础设施也要重新为机器设计

Sarah Wang: 我知道Databricks一直有FDE,也就是Forward Deployed Engineer。这个词现在很流行,但如果真要把AI落到这么大的企业里,是不是就必须采用一整套FDE模式,让工程师直接深入客户现场?你们这套模式具体是怎么做的,又是怎么演进的?

Ali Ghodsi: 我们其实一直都有FDE,只是最近需求明显增加了。这里面很大一部分工作,和前面讲的Ontology有关。Ontology本身最后是可以自动构建的,但如果一家企业根本没有在收集信息,比如会议没有记录、重要沟通没有数字化,那系统就没有东西可以拿来构建Ontology。所以这也是我们帮助企业做的第一类事情:先把那些必要的信息真正收集起来。

另一类工作,就是企业会说:“我想做一个Agent,而且我希望它直接面向客户。”那这个Agent就必须满足很多真正上线以后才会遇到的要求:它要有非常低的Latency,不能让客户一直等;还要有Guardrail,避免别人滥用它,或者通过各种方式诱导它回答企业不希望回答的问题。比如Fox有一个Sports AI,你可以和它聊各种体育赛事,但如果你故意开始问政治,它会非常稳定地拒绝,然后把话题重新引回体育。这个系统就是FDE帮助他们构建的。

所以FDE做的事情,本质上就是帮助一家组织真正开始使用AI。 这很重要,因为很多企业内部还没有足够的专业能力去独立构建这些系统。它们往往不需要别人永远替自己做,而是需要有人先在旁边帮一把,把第一套东西真正跑起来,然后它们自己的团队才有可能继续往下走。

Sarah Wang: 这也正好和Agent有关。我最近看到一个挺有意思的结果,好像是一个相对中立的第三方做了测试,发现LakeBase或者Neon实际上已经成了Agent很偏爱的Postgres数据库。我觉得这件事很有意思,一方面当然对Databricks是个好消息,但另一方面,如果是一年前,我大概完全猜不到结果会是这样。数据库市场里还有不少产品拥有很强的Developer Momentum,但在那个测试里,LakeBase / Neon似乎非常明显地排在前面。你们到底是怎么做到的?因为现在如果能赢得Agent,好像就开始有机会赢得整个市场。

Ali Ghodsi: 对,这件事确实挺让人意外的。我觉得这里面很大一部分功劳应该给Neon的Nikita和整个团队。他们做的一件事情非常简单,但又非常极端:他们一直在执着地问,怎样让模型主动选择我们?怎样让Agent更愿意把LakeBase或者Neon当成自己的数据库?

你想想Agent真正工作的时候是什么状态。它经常会出去做Experiment,尝试构建一小段软件,突然之间需要一个数据库。这时候它不想等,它需要数据库立刻起来。所以Neon团队几乎到了偏执的程度,要求所有东西都必须远低于一秒。数据库启动要远低于一秒,甚至一个TB级别的大数据库,也可以在不到一秒的时间里完成Clone。整个系统因此变得非常Elastic,也非常Responsive。

他们还做了一个非常关键的功能,叫Branching。你可以直接给一个数据库创建Branch,而且同一个数据库可以同时存在很多很多Branch,整个过程又非常轻量。其实我们已经在其他Agent工具上看到过同样的方向,比如uv、ripgrep,包括很多Unix工具都被重新实现了一遍,目的就是让它们变得极快、极轻量,同时对Agent来说更加Fail-safe。Neon只是把这套逻辑放到了一个困难得多的问题上——数据库。

所以现在你有了一个Postgres数据库,它依然保留Postgres本身的各种优势,但同时又很快、很灵活,而且对Agent来说更加安全。它可以回到之前的Snapshot,也可以做这些快速恢复、快速试错的事情。我觉得这就是为什么Agent更容易使用它。

另外,他们在定价上也专门做了设计。因为你不希望Agent只是为了写一点软件、做几个实验,就不知不觉把数据库成本烧得很高。如果已经进入Production,有大量真实用户在使用,那企业当然愿意为数据库付费;但如果只是Agent在做Experiment,那成本就必须非常低。

所以我觉得他们真正执着的事情,不是“怎么打赢数据库战争”,也不是“怎么比另一家数据库Vendor更强”,而是:我们怎么才能成为对Agent最好用的数据库?这其实创造了一个过去数据库行业几乎不存在的新Persona。以前做数据库,厂商思考的是:怎么服务DBA?怎么服务Application Developer?怎么帮助真正使用数据库的人?但Neon改变了这套思路,它问的是:如果未来真正使用数据库的主体越来越多不是人,而是Agent,那我们应该怎样专门为Agent设计数据库?

现在这个变化已经非常明显。Neon和LakeBase上新创建的数据库里,超过90%实际上已经不是由人类创建,而是由Agent创建的。所以这个数字本身已经说明很多问题。

Sarah Wang: 哇。

Martin Casado: 顺便说一句,这真的非常惊人。我现在已经开始把Neon当成自己的默认数据库。对我来说很奇怪的一点是,一般一家创业公司进入一个更大的公司以后,大家往往会担心产品速度变慢,但Neon反而明显变得更好了。

Ali Ghodsi: 对。

Martin Casado: 那他们现在还是完全独立运作吗?还是已经和Databricks其他团队一起工作了?

Ali Ghodsi: 不是完全独立,他们和我们合作得很紧密。这真的是一支非常优秀的团队。我们本来就非常喜欢数据库,也喜欢Data,这就是我们每天生活在里面的东西。所以他们现在做得非常好:产品非常快、非常灵敏,而且确实非常适合Agent。

Martin Casado: 好,那最后一个问题。Ali,你的pDoom是多少?

Ali Ghodsi: 低于10%。不,开玩笑的。接近于零。

Martin Casado: 我的答案可能是——我不知道具体是多少。但我唯一会说的是:没有AI时,我的pDoom比有AI时更高。这个回答怎么样?

Ali Ghodsi: 哇,那又是另一个话题了。

Sarah Wang: 这个问题上,我应该会同意Ali。

Ali Ghodsi: 好,很好。

原视频:Why Would AI Companies Want to Slow Down?

https://www.youtube.com/watch?v=GzEtpAKYRvE

编译:Murphy Cao

文章标签应用落地学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多