
模型发布越来越频繁,排行榜上的分数也越来越高,但一个更基本的问题正在变得难以回答:这些模型究竟进步了多少,又能在真实工作中创造多少价值?
在这场访谈中,AI 评测公司 Vals 联合创始人 Rayan 提到了一个典型案例:Llama 4 在主要公开 Benchmark 上表现亮眼,却在 Vals 的保密测试中低于预期。当试题和评分标准全部公开,榜单成绩与实际能力之间,可能出现越来越大的距离。
Rayan 的研究背景集中在 Benchmark 与模型评估。2024 年,他与团队创立 Vals,希望为模型实验室、企业和政策制定者提供独立的能力验证。这场对话从公开评测为何失效,延伸到 Coding Agent 的真实成本、政府与私人机构的分工,以及如何衡量 RSI 。他的主要观点包括:
AI 需要独立测试机构,模型公司的自我报告不足以支撑整个市场。 实验室可以用内部评测指导研发,但当企业需要决定采购、投资者需要判断数十亿美元研发投入的价值时,市场还需要一套独立、可信的验证机制。
评测本身就是推动模型进步的基础设施。 构建新系统与设计新评测紧密相连:只有清晰识别模型缺少什么能力,研发才能找到改进方向。随着任务变得复杂,评测也会从大量简单题目,转向样本更少、标准更多、要求更高的真实任务。
企业选模型,应当比较完成任务的总成本。 单价更低的模型,可能因为消耗更多 Token、需要更多尝试而变得更贵。模型、Agent 工具和运行框架需要一起评估,并根据具体任务推荐组合,而非为整个团队指定一个统一的“最佳模型”。
无限使用 Agent,可能让算力账单远超工资。 Rayan 回忆,Vals 曾在一个月的免费使用期内消耗价值约 150 万美元的 Token,相当于同期员工工资的约十倍。这促使团队分析真实工作轨迹,为每个 GitHub Issue 推荐起步工具,把“尽可能多用 AI”转向“更有效地完成工作”。
知识工作的评测应从已有的人类工作成果中建立。 企业积累的代码、文档、表格和交付记录,可以成为动态评测的基础。关键是把这些成果转化为明确的任务与评分标准,检验模型能否达到实际工作要求。
AI 政策需要具体证据,风险测试也必须进入真实部署环境。 “模型可能带来网络或生物安全风险”还不足以指导监管。评测需要区分模型具备什么能力、能否被诱导执行危险行为,以及实际环境中的护栏是否有效;网络安全测试也应扩展到企业云和电网等更大规模的基础设施。
政府与评测机构需要分工:公共部门确定规则,专业机构提供验证。 Vals 的职责是收集能力与风险证据,帮助政策制定者理解技术变化。政府负责制定并执行规则,具有专业能力的私人机构负责判断具体行为是否违反规则。
各国需要一套共同的评测语言,才能讨论 AI 风险与自我改进速度。 Rayan 借用“信任,但要验证”的思路,认为国际协调可以从网络安全、生物安全等共同利益开始。长期来看,如果模型能够参与开发下一代模型,各方还需要能够共同描述和验证:能力提升到了什么程度,发展速度是否超出了可接受范围。

为什么Vals存在:当公开Benchmark不再有效
Erik:每当一个新的万亿美元级产业出现时,就需要一个独立的测试机构。当Meta发布Llama 4时,在我们保留的私有Benchmark测试中,这个模型实际上表现不佳。但在所有主要的公开Benchmark上,它却展现出了惊人的能力。你的目标上限是什么?在这个范围内,你们是如何推进的?
Rayan:理想情况下,我们希望让一个frontier model训练出自己的下一代版本。但显然,这个过程成本极高,而且速度很慢。因此,我们正在做的是,为构建下一代模型所需要经历的每一个环节建立一套代理指标(proxies)。随着Evaluations变得更加复杂,它们往往拥有更少的样本量,但包含更大的标准集合和更高的期待。
Erik:你怎么看待当前存在的差距?政府目前对于风险有一些担忧,比如生物黑客(biohacking)、网络攻击(cyber hacking)。但随之而来的问题是:模型是否能够做到这些事情?以及,你是否能够让模型去执行这些事情?你认为未来的整体格局会是什么样?
Li:我想从一个问题开始。Vals在2024年成立,当时团队发现,所有公开Benchmark都不足以衡量模型的发展进度,因此需要一种新的方法论和路径,帮助我们保持在frontier上,并推动模型实验室持续提升。可以先带我们回顾一下Vals的起源吗?当时市场中缺少了什么?
Rayan:我的背景是进行研究,尤其是构建Benchmark和Evaluation。对我来说,非常明确的一点是:构建新一代系统,与建立新的Evaluation机制之间存在非常紧密的关系。事实上,为了获得其中一个能力,通常也需要提升另一个能力。而推动模型能力提升最大的因素之一,就是拥有一种新的、清晰可理解的方式去评估模型。所以在2024年初,我们看到市场上出现了很多有趣的新模型。它们并不全部来自OpenAI。同时,更重要的是,我们发现,要真正判断这些新模型具备了哪些新的能力,比过去任何时候都更加困难。
因此,从第一性原理出发,我们意识到:市场需要一家第三方公司,专门负责构建高质量的Evaluation和Benchmark,从而判断这些模型到底能够实现什么。所以,我们在2024年发布了第一批Benchmark。过去几年里,行业中的许多不同参与者也逐渐认识到了这一需求。
Li:另一个显而易见的问题是:为什么这些实验室不能自己完成这件事?因为他们最了解自己的模型正在向哪些方向提升,以及模型能力方面还缺少什么。为什么他们不能成为Benchmark提供方?
Rayan:事实上,模型实验室内部确实会构建很多优秀的Benchmark,而这些Benchmark也是推动模型进步的重要因素。但我认为,当我们讨论模型能力时,如果这些信息完全来自模型公司的自我报告,就会出现问题。一个早期明显案例就是Meta发布Llama 4的时候。那次发布引发了很大争议。
有意思的是,我们发现在我们的保密私有Benchmark中,Llama 4的表现实际上低于预期;但在所有主要公开Benchmark中——这些测试的问题和评分标准都是开源的——它却展现出了非常强大的能力。因此,在基于公开Benchmark的自我报告结果,与我们通过更高质量、更高信号密度的Benchmark得出的结果之间,存在巨大差距。
但我认为,这反映了一个更广泛的问题。我相信各大实验室也理解,他们希望看到一个更加理性的市场。也就是说,当他们投入数十亿美元开发新模型时,他们需要有实质性的证据证明“我们的模型正在这些方面取得进步。”而不是仅仅依靠自我报告来证明投资价值。因此,你也看到行业中的Demis等人呼吁建立一个第三方Evaluation生态系统。
Erik:你认为这里有什么历史类比?比如评级机构(rating agencies)、审计公司(audit firms),哪个更接近?
Rayan:我认为,我们可以从很多不同领域吸取经验。每当一个新的万亿美元级产业出现时,都需要一个独立测试机构。而AI发展速度如此之快,也让这种需求迅速出现,并形成了许多类似的模式。我们认为自己的角色是站在市场双方之间。一方面,模型实验室需要证明他们的新模型具备强大的能力;另一方面,企业也需要判断怎样的采用策略能够为他们带来最高的投资回报(ROI)。

模型发布前的6小时测试窗口
Erik:我想让你带我们了解一下模型发布前的6小时测试窗口。显然,你们需要在不延迟模型发布的情况下运行数百亿Token的测试。其中哪些部分需要你们熬夜人工完成?哪些部分已经实现自动化?
Rayan:这其实经历了一个发展过程。我们的核心目标是:我们永远不希望自己成为模型发布的滞后指标,或者成为发布流程中的阻碍。这意味着,我们必须非常快速地行动,并在有限的速率限制和计算能力下提取尽可能多的信息。
早期阶段,我和我的联合创始人Lynx会熬夜工作,尽可能完成测试并及时输出结果。现在,我们已经建立了团队,同时投入大量资源建设基础设施。因此,我们能够以大规模分布式方式运行Evaluation,基本利用每个模型访问权限所允许的最大速率限制。此外,我们还有一个内部系统,叫作Steve。Steve是 “the economic Vals employee”。它帮助我们逐渐把更多原本需要人工完成的工作转移到系统中。
Ben:我们已经看到很多非直观的案例,实际上必须运行Evaluation,才能知道某个代码仓库真正的frontier performance是什么。现在你也会看到一个非常复杂的中间选择空间。目前Anthropic有Opus和Sonnet模型,同时还有Luna和Terra等模型。其中Luna在成本方面非常有竞争力。Muspark的价格也非常低,而1.2版本具备很强的能力。此外,还有不断增长的开源模型生态,企业可以选择自行部署这些模型。所以在这个复杂的中间区域里,真正适合哪种模型其实并不直观。我们发现很多情况下,Sonnet的成本甚至高于Opus,因为它消耗了大量Token。如果你只是按照“在适合的时候使用Sonnet”这样的方式运行,最终可能会花费超过实际需要的成本。能否进一步谈谈,这套Evaluation框架未来会如何应用到其他领域的知识工作中?有哪些例子?
Rayan:我认为Coding是未来所有领域发展的一个信号,其中建立起来的大量基础方法(primitives)正在被迁移到其他领域。如果你拥有一个非常优秀的Coding Agent,那么很可能你也拥有一个能够制作PowerPoint、处理文档和Excel,并且具备高水平能力的模型。不过,我认为很多行业真正需要利用的是现有的大量工作成果和数据积累,把它们作为构建Evaluation的基础。正如Ben之前提到的,我们实际上还没有完全解决“什么是人类智能”这个问题。但在很多行业中,我们已经拥有大量关于人类工作成果的数据记录。接下来,我们和其他人需要做的是,将这些内容编码成动态的Evaluation,使其能够真正评估模型在实际人类工作场景中的表现。
Li:接着之前的问题,你们是如何使用VSmith来评估Vals内部到底应该使用哪一个Coding Model?
Rayan:坦白说,这个工具实际上也是源于我们自己遇到的问题。我曾经想做一次Token Maxing实验。我们获得了一个月的Coding Tools无限访问权限。现在回头看,当时我们有很多工程师每天消耗10亿到20亿Token。峰值的一天,一个工程师消耗了60亿token。
Li:这非常夸张。换算成美元的话,大概是多少?
Rayan:后来我重新计算了一下。结果显示,那一个月我们消耗的Token价值大约是150万美元。当然,这个服务当时是免费的。实际上,更令人惊讶的是:那个月我们的Token支出价值,大约是员工工资支出的10倍。并不是说两者接近,比如50/50,而是整整10倍。
后来我们进行了复盘,分析人们使用Agent的方式,以及这种随时随地使用模型的习惯。我们发现我们不能继续以这种方式运营下去。因此问题变成了:如何更智能地判断,我们应该使用哪些工具?哪些团队应该使用?哪些项目应该使用?
于是我们进行了实验。我们分析已经完成的工作,查看大量使用轨迹,检查我们的GitHub Repository,并构建出了Val Smith工具。我们得到了一些非常意外的发现。例如,Cognition的Devin工具实际上非常节省Token。因此,我们选择更多采用它。另外,我们发现很多情况下,基于订阅模式的定价,比基于Token的定价更加划算。这些结果也影响了我们的策略:如何有效地最大化Token使用效率,同时避免每个月花费150万美元。
Li:非常有意思。所以你们目前的运行方式是不是:使用一个更加节省Token的Harness加Model组合,然后在此基础上,让员工有更大的灵活性,在一些更高级或者更具挑战性的任务中使用基于Token的方案?
Rayan:是的。我们可以访问所有工具,也向所有人开放所有工具。但是,对于任何GitHub Issue或Ticket,我们都会自动提供推荐:他们应该从哪个工具开始自己的工作流程。这样可以根据任务所需要的智能水平,动态调整实际使用情况。

AI安全与政策:Evaluation如何连接政府与产业
Erik:非常好。我想暂时转向政策层面。我们之前讨论过Benchmark很快会失效的问题,而在政策领域,这个问题更加明显,因为法律的发展速度相对于技术能力变化要慢得多。Ben和Mark花了大量时间在华盛顿特区以及与政策制定者沟通,试图缩小这个差距。那么,从政策角度来看,这里的标准应该由谁来定义?是模型实验室?是像你们这样的独立 Evaluation 机构?是客户?还是政府?应该如何建立这样的机制?
Rayan:简单来说,我认为所有参与方都应该在一定程度上参与其中。不同视角的结合是有价值的。但我认为,目前最大的问题是:过去几年里的政策讨论非常抽象。它们缺少实际依据,因此很难判断政策到底应该覆盖什么。所以,即使模型实验室提出建立第三方测试公司或Evaluation生态系统,也没有明确说明:这些机构具体应该如何运作,以及它们应该测试什么行为。因此,我认为Vals早期阶段的重要角色之一,就是进行证据收集。我们希望能够收集大量关于模型能力以及风险的实际数据。这些数据可以进一步推动更加成熟的政策讨论。
Erik:你怎么看待不同参与方之间应该如何分工?因为政府实际上已经开始进行第一轮Evaluation。比如判断:什么能力处于frontier,需要进行监管。他们曾经提出过类似“10到26FLOPS”这样的指标。那么,你认为政府应该在所谓的30天等待期、60天等待期或者类似机制中做什么?等待期间应该发生什么?这与你们正在做的事情有什么交集?以及,应该如何判断一个模型是否处于frontier,是否需要暂时被放入某种特殊监管范围,以确保它不会造成更大的风险?你怎么看这种关系应该如何建立?
Rayan:我认为这里实际上存在两个相互制衡的力量。第一,是希望快速推进技术发展,确保政府流程不会减缓技术创新速度。第二,是确保技术发展方向符合美国以及更广泛社会的利益。我认为这两个目标非常难以同时实现。很多时候,选择其中一个,就意味着会牺牲另一个。因此,我希望通过这样的证据收集过程,帮助政策制定者了解:他们认为技术应该朝什么方向发展,才能符合社会利益。
而第三方Evaluation机构的作用,则是开发能够真正测试和执行这些标准的方法。因为这样才能建立一种机制:让Evaluation和测试方法能够跟上技术前沿,而不是落后于技术发展,或者阻碍创新速度。
Li:在你们开发Evaluation的过程中,你们是否考虑过能不能测试模型是否容易开始进行Reward Hacking,或者类似行为?比如执行非法活动?这是否属于目前的评估范围?
Rayan:我们通常会把这类问题归入 Alignment(对齐)这一大类。现在已经有一些案例显示:某些模型在接受网络安全风险测试时,会进行Reward Hacking,并寻找其他方式绕过限制。但我们真正想评估的是:模型是否与用户意图保持一致。因此,在那些场景中,如果我们发现模型表现出偏离用户意图的行为,就会进行记录和分析。
Li:Ben,这个问题也想请教你。你怎么看这里正确的分工?政府机构应该控制和执行哪些事情?哪些领域应该与私人公司合作,或者信任私人公司来处理?目前最大的差距在哪里?
Ben:我认为,政府机构确实会从大型模型实验室那里收到很多警告。比如:“这个模型可能被用于生物黑客。”“这个模型可能带来网络安全风险。”等等。所以,我认为政府需要回答的问题是:如果模型具备某种能力,那么是否有人能够推动市场中的参与者利用它去实施非法行为?以及,具体哪些行为是不希望市场出现的?然后,需要有第三方机构对这些能力进行评估。
政府特别不适合长期执行后一个任务。这并不是一个理想的政府职能。但是,政府非常擅长制定规则,因为它能够执行规则。所以,我认为理想组合是:政府制定并执行规则,而一个具有专业能力的私人机构负责判断规则是否被违反。
我们已经看到一些大型实验室开始采取这样的方式:他们认为:“模型已经具备某种能力,也可以被诱导去完成某种危险行为,因此我们不会让任何人获得它。”他们会自己使用模型,并确保自己的人员不会让模型执行危险行为。但即使这样,也并不总是有效。所以,我们正处于一个非常有意思的时代。

Evaluation的地缘政治:不同国家如何建立共同标准
Erik:对我来说,这其中存在一个明显差距:那就是叙事与现实世界实际发生情况之间的差距。因为每一种部署环境都非常不同。例如企业环境,或者不同用户使用模型的方式,都存在巨大差异。连接这些真实案例的叙事其实非常少。这也是为什么我们今天仍然讨论OpenAI和Hugging Face的安全事件。我们仍然讨论Fable发生的事情,并持续讨论了大约两个月。
但很多时候,模型实际部署的环境并不是这样。它们运行的环境通常是高度定制化的(bespoke)。那么,如何真正连接这些差距?如何建立正确的环境和规则体系,让人们能够放心采用这些模型?
Rayan:我认为,这同样需要有人把模型能力,以及对应的安全护栏,真正落实到实际应用环境中。这样,人们才能有信心使用这些模型。
Erik:能否进一步说明:政策制定者应该如何与Evaluation机构合作?他们需要哪些信息?双方关系应该如何建立,才能达到最高效率?
Rayan:我认为,首先应该建立一种机制,让洞察和数据能够直接传递给政府中的相关人员。目前,我们已经定期向行政部门和立法部门进行简报,介绍我们发现的模型能力以及风险。第一层意义上,这能够帮助政府人员了解当前正在发生什么,并追踪未来可能出现的问题。事情发展非常快,很难准确预测未来。但至少,当你拥有数据时,就可以开始推断趋势。之后,立法部门需要决定:哪些领域需要政策介入。这并不是我们的职责。我们不会直接提出政策建议。
但是,如果他们发现:例如,18岁以下人群的心理健康风险,或者模型中的生物安全风险,需要建立标准化方式限制模型发布,那么制定政策就是他们的职责。与此同时,在商务部(Department of Commerce)或者SEC等机构负责的领域,行政部门需要确保私人企业能够以有利于整个系统发展的方式采用和使用这些模型。
Li:我想从另一个角度深入讨论一下地缘政治问题。我经常看到Evaluation被认为是某种模型价值观的体现。也就是说,模型开发者会设计一套评分标准,而这些标准实际上会把某些价值观嵌入模型之中。当然,不同国家以及不同国家中的模型实验室,关注的重点也不同。那么,你怎么看待Evaluation和Benchmark在不同地区模型实验室之间发挥的作用?它们是否能够帮助建立统一标准?或者,不同地方的模型实验室会如何看待这些标准?
Rayan:坦率地说,从我非常理想主义的角度来看,我对于目前大量投资“主权AI”(感到有些意外。如果站在一个全局视角来看:建设所有这些数据中心,重复进行数据工程流程,并训练这些大型模型,实际上可能效率非常低。事实上,很多工作或许可以进行整合。但现实似乎并不是这样,也不是我们正在走向的方向。
目前,越来越多的努力正在投入到以主权方式建设AI。因此,我认为,这需要建立一种共同语言:让不同参与方能够讨论Evaluation的框架是什么,以及我们应该如何共同对齐风险。我认为,在这一点上,我们其实可以从核领域学习很多经验。Reagan曾经提出过一句话:“Trust but verify(信任但要验证)。”现在,我们似乎开始看到一些信任的迹象。
但是,目前仍然没有清晰的方法来完成“验证”这一部分。如果我们拥有共同的Evaluation语言,就能够讨论类似这样的问题:“你拥有正确数量的核弹头。”在核领域,也存在类似机制。例如,通过空中侦察(flyovers),一个国家可以审查另一个国家的核武器储备。因此,如果人们担心AI带来的社会风险,甚至生存风险,那么我们也需要建立一套共同的Evaluation语言,用于完成验证过程。
Li:你怎么看待如何协调这样一种政策?因为仅仅在美国内部完成协调已经很困难。那么,如果进一步扩展到全球范围,你怎么看?现在面对的不再是企业客户,而是不同国家政府。而这些政府之间存在竞争关系。你认为这种协调应该如何实现?
Rayan:如果我说自己今天已经拥有这个问题的完美解决方案,那是不现实的。所以,我认为我们需要从一些小步骤开始。例如,现在人们经常讨论网络安全风险。我认为,随着时间推移,生物安全风险的重要性也会越来越高。在这些领域,存在一些明确的共同利益:不同国家可以围绕防止网络冲突或生物风险建立协调机制。但在我看来,长期来看,最有趣的问题可能是递归式自我改进(recursive self-improvement)的可能性。
这是一个领域:某个国家,或者某家公司,可能会快速领先,并产生我们并不了解、或者以未知方式运行的模型。因此,建立一种共同语言,让各方能够描述:“这是我们能够接受的发展速度。”或者:“这个速度已经超过了我们对于 RSI(Recursive Self-Improvement)的可接受范围。”这将非常重要。这也是为什么你会看到很多闭源实验室(Closed-source Labs)的研究人员呼吁:各国政府之间应该开展联合讨论。
Li:你认为从现在开始,整个格局会如何发展?现在我们拥有大量不同能力的模型,也拥有越来越强大的模型。同时,不同国家的发展重点也不同。当然,每个人都关注RSI。但在生物安全或者网络安全方面,不同国家关注的重点可能略有不同。比如,有些更关注攻击能力,有些更关注防御能力。你认为未来的格局会是什么样?以及,你们如何开发新的Benchmark来跟上这些变化?
Rayan:我们目前高度关注的是构建能够捕捉frontier能力的Benchmark。只要我们发现新的能力领域,或者frontier上新的风险领域,我们希望能够将它们转化为真正可记录、可验证的Evaluation,并在Val.AI上呈现出来。我认为,这需要随着时间推移不断扩大覆盖范围。例如,在网络安全领域,我们过去大量工作集中在:代码漏洞(code vulnerabilities)或者代码中可能存在的内存泄漏(memory leaks)。但实际上,很多最大的风险来自基础设施层面。这些问题并不是通过代码本身体现出来的。
我们需要模拟更大规模的环境:例如企业云基础设施,甚至电网基础设施,才能判断模型的攻击能力和防御能力。因此,确保Evaluation能够反映这些新的能力领域,对于Vals来说非常重要。我们相信,这类业务最有价值的发展方向,是建立在激励一致的基础上:专注于提供高质量Evaluation,而不是支持智能开发过程,或者帮助模型自身随着时间不断提升能力。
Erik:非常感谢你参加这期Podcast。这一期节目非常精彩。
Rayan:非常感谢你邀请我。
Erik:也谢谢你,Rayan。谢谢你,Ben。这次交流很有意思。
原视频:Inside the Race to Measure Frontier Intelligence
https://www.youtube.com/watch?v=WO9c9qxDxzU
编译:Charlotte Chen







