2023年,一位化学家做了个实验。他给一个大语言模型配上了实验室工具,让它自主设计和执行化学反应。论文发表在《Nature》上,标题很唬人:"用大语言模型进行自主化学研究"。这类系统这几年层出不穷,AI Scientist、Co-Scientist、Kosmos,一个比一个名字响亮,一个比一个宣称自己能独立搞科研。
但这里有个问题一直没人正面回答:这些系统到底是自己想出了研究方法,还是只是把人类已经想好的方法翻译成了代码?
这个问题听起来像是吹毛求疵,但差别巨大。一个学生能把老师写好的实验步骤一步步做出来,和一个学生自己设计出这个实验步骤,是完全不同的两种能力。前者是执行力,后者才是真正的科研能力。而现在几乎所有评测AI科研能力的基准测试,都没有把这两件事分开算。
这就是ASI-Bench这篇论文想解决的事情。它不满足于问"AI能不能把研究做完",它要问的是"如果把人类的指导一层层拿掉,AI还能走多远"。
科研评测的老问题:大家都在测"抄作业"能力
先说说这个领域现在是什么水位。
**Humanity's Last Exam**
*一个覆盖各学科前沿知识的高难度问答基准,简称HLE。*
这类测试很擅长考AI"懂不懂",但它考的是问答,不涉及数据处理和代码执行,更谈不上完整的研究流程。
**SciCode**
*一个专注科研级编程能力的基准测试,由科学家编写题目。*
这类测试更进一步,让AI写科研代码,但题目本身还是把要实现的算法讲清楚了,AI要做的是"翻译",不是"发明"。
再往上还有**Terminal-Bench**(测试AI用命令行工具解决复杂任务的能力)、**PaperBench**(测试AI复现已发表论文的能力)、**MLE-Bench**(测试机器学习工程能力)等等,覆盖面越来越广,但有个共同特点:几乎所有任务的目标、方法、评价标准都是提前定好的,AI要做的是把这套流程走一遍。
论文里给了一组数字很能说明问题。在GPT-5.6 Sol这个模型上,HLE得分62.1,SWE-bench(代码工程能力测试)得分79.2,Terminal-Bench得分88.8,看起来都是相当不错的分数,仿佛AI已经很厉害了。可同一个模型在ASI-Bench上的B3设置(后面会详细讲B3是什么)只拿到40.7分,直接腰斩还多。
这不是因为ASI-Bench的题目更难,而是因为它问的是一个完全不同的问题:不是"你能不能照着说明书组装这台机器",而是"如果没有说明书,你能不能自己搞明白该怎么组装"。
如果这个类比还不够具体,想象一下宜家家具。你拿到一份带图纸的说明书,按部就班拧螺丝,这是B1式的任务,考验的是执行力和耐心。现在把说明书撤走,只告诉你"这堆零件最终要拼成一个能放四本书的书架",你得自己琢磨结构、判断哪个零件该装在哪,这是B3式的任务,考验的是完全不同的能力。如果不做这个区分,你永远不知道一个人是真的会做家具,还是只是照着说明书手很稳。
ASI-Bench怎么设计这套"渐进撤梯子"的测试
ASI-Bench的核心设计只有一句话能概括:同一个研究项目,用四种不同程度的"剧透"来问AI,看它的表现怎么随着提示的减少而变化。
具体分成四档,B1到B4。
**B1(完整方法指导)**
*给出完整的科学背景、公式、数值方法、求解步骤,AI主要负责把这套流程正确实现出来。*
B2只给出方法的名字和大致方向,不给具体步骤,AI要自己把一个方法名变成一套可执行的完整流程。B3更狠,连方法名都不给,只给研究目标和原始数据,AI必须自己判断该用什么模型、什么方法、怎么验证。B4在B3的基础上,故意塞进一堆似是而非但其实无关的干扰信息,测试AI会不会被带偏。
论文里举了个具体例子,是一个二维非线性动力系统的建模任务。在B1里,题目直接把控制方程写出来了,是一个很复杂的各向异性Kuramoto-Sivashinsky型方程,甚至连数值求解用的ETDRK4算法的每一步公式都列得明明白白,AI基本上是照抄照做。到了B3,题目变成只给你三个数据文件,一句"这是一个二维非线性系统在周期性空间域上的演化数据,帮我搞清楚它的时空结构,建一个能重现这个动态的模型,预测未来某个时刻的场,再提取一些有物理意义的量",剩下的全靠AI自己摸索。
这个设计思路让我想起考驾照。科目二在固定场地按固定路线练库位,这更像B1,路线、指令全给你写好了;真正上路开车,面对突发状况自己判断怎么变道、怎么应对,这才是B3。很多人科目二满分,真上路却手忙脚乱,因为两种能力根本不是一回事。如果驾考只考科目二不考路考,我们永远不知道一个人真实的驾驶能力,这正是过去大部分科研基准测试的盲点。
60个任务,11个学科,31000小时:这个基准是怎么造出来的
光有设计理念还不够,题目本身的质量才是关键。ASI-Bench最后落地的是60个项目级研究任务,横跨11个学科:数学、物理、化学、生物、天文、材料科学、地球科学、医学与生物统计、计算机科学、机器人学、电气工程。
这个覆盖面背后是极其重的工程。论文披露,整个构建过程从超过1300个候选研究想法开始,经过5轮评审,超过1100次评审分配,2000多次任务修订,累计投入超过31000人工小时,由40多位专家共同完成。每个留下来的任务还要在沙盒环境里跑一遍完整流程,验证参考答案能不能复现、打分逻辑稳不稳定,全程超过1500次沙盒测试。
这么较真是有原因的。**如果一道题的答案能靠蒙对,或者存在某种取巧的捷径能拿高分而不需要真正解决问题,这道题就毫无评测价值**。
论文特别提到,评审员要专门检查"信息泄露"和"意外捷径",就是怕AI靠碰运气或者钻空子拿分,而不是真正把研究做出来。
这套流程还挺像顶级期刊的同行评审,只不过评审对象从论文变成了"任务本身设计得合不合理"。一篇论文如果实验设计有漏洞,结论再漂亮也站不住脚;一道评测题如果存在捷径,AI再高分也说明不了问题。
单个任务的复杂度也不低。60个任务加起来,完成整个研究流程需要超过2600轮交互和2400个执行步骤,累计超过35小时的agent执行时间。这不是那种几秒钟能出答案的选择题,而是真正意义上的长周期研究项目,要经历理解问题、选方法、写代码、跑实验、诊断失败、反复调整、验证结果这一整套流程。
结果揭晓:AI一旦没了详细指导,表现直接腰斩
现在看最核心的数据。研究团队测试了18种不同的Agent配模型组合,包括Codex配GPT-5.6、Claude Code配Claude Opus 5、各种开源模型组合等等。
先看总体趋势:平均分从B1的50.91分,掉到B2的29.10分,再掉到B3的26.62分。
**B1到B2这一步下降了21.82分,是整个曲线里最陡的一段。**
这个数字值得多说两句。B1到B2之间,唯一的变化是把"具体怎么做"的详细步骤拿掉了,但"用什么方法"这个信息其实还留着。按理说这不该是个太大的坎,因为AI已经知道大方向了,无非是把方向细化成步骤。可实际情况是,这一步的跌幅比后面"完全不告诉你用什么方法"(B2到B3只降了2.48分)还要大得多。
这说明了一个挺反直觉的事实:**当前AI系统最缺的不是"知道该用什么方法"的判断力,而是"把一个方法名变成一套完整可执行流程"的操作能力。**
换句话说,AI大多数时候能猜到大概方向该往哪走,但让它把这个方向变成一行行能跑通的代码、一步步严谨的推导,它就开始掉链子。这有点像很多人知道"减肥要管住嘴迈开腿"这个大方向,但真让他们制定一份具体到每餐吃什么、每天练多久的计划并且严格执行,大部分人做不到。方向感和执行力之间隔着一条很深的沟,AI现在恰好卡在这条沟里。
再看B3到B4,几乎没有变化,26.62分掉到26.99反而还涨了一点点(当然在误差范围内基本可以视为持平)。这说明干扰信息对AI影响不大,真正的瓶颈不是"会不会被带偏",而是"有没有能力从零开始搭一套研究流程"。
具体到单个系统的表现,最强的是Codex配GPT-5.6 Sol(ultra版本),B3拿到51.60分,是唯一一个在这个最难档位上过50分的系统。而且论文里提了一个很有意思的细节:同样是GPT-5.6 Sol,把推理强度从xhigh调到ultra,B3分数从40.86跳到51.60,涨了10.74分。这说明加大推理投入确实能提升自主科研能力,但也从反面说明这件事有多难,得靠堆推理成本才能勉强够到及格线以上。
作为对比,Claude Opus 5配Claude Code拿到B3的40.70分;开源阵营里表现最好的是GLM-5.3,33.09分;表现最弱的几个组合,比如MiMo V2.5 Pro配MiMo Code,B3只有11.50分。
换个"外壳"能不能提升AI的表现?能,但不是万能药
论文还发现了一个很值得琢磨的现象:同一个底层模型,换个执行框架(论文里叫Harness),表现能差出一大截。
**Harness**
*指AI Agent实际运行时依赖的执行框架和工具系统,包括代码运行环境、工具调用方式、任务管理逻辑等,相当于给AI大脑配的"手脚"。*
具体数字很说明问题。MiMo V2.5 Pro这个模型,配上自家的MiMo Code框架,综合得分只有16.17,换成Claude Code框架,直接跳到23.25。Kimi K2.7也是类似情况,配Kimi Code是19.72分,配Claude Code是27.34分。
但这个规律不是绝对的。Kimi K3配Kimi Code是36.22分,配Claude Code是37.09分,差距很小,几乎可以忽略。
这说明**科研能力这件事不能只看模型本身,还要看模型和它所依赖的执行系统之间的配合**。
这就好比同一个厨师,在设备齐全、动线合理的厨房里能做出一桌好菜,换到一个刀具摆放混乱、灶台高低不平的厨房,同样的手艺可能就发挥不出来。如果只测厨师本人的水平却忽略厨房的差异,你评出来的排名可能根本不准。这也是为什么论文特别提醒,比较不同模型的能力时,如果不把它们所用的执行框架考虑进去,很容易把系统设计的功劳错记到模型头上,或者反过来。
花钱多不代表分数高:成本和性能的错位
论文还测了一个大家都关心的问题:这么复杂的任务,到底要烧多少钱多少时间?
先看token消耗和执行时间。B1(有完整指导)是最省钱的,平均每个任务消耗440万token、37.8分钟。B2最费钱,需要690万token、49.7分钟,比B1多了59%的token和32%的时间。B3和B4分别比B1多耗25%和30%的token。
**B2最贵这件事,乍一看有点反常识。**
B2不是应该比B3更简单吗?毕竟B2好歹给了方法名。但实际情况是,B2这种"只给你个方向但不给具体路径"的设置,反而让AI陷入一种两难:它被限定在一个特定方法框架里,又得自己把这个框架里所有的实现细节都摸索出来,这个过程比彻底自由探索(B3)还要费劲。
这就像老板告诉你"这个项目用敏捷开发",但具体怎么排Sprint、怎么分任务、用什么工具全靠你自己琢磨,你反而会在"到底什么才算标准的敏捷开发"这个框架本身上纠结半天,效率不见得比完全自由发挥高。**不完整的指导有时候比没有指导更消耗资源**,这是这篇论文一个挺重要的发现。
再看性价比。Codex配GPT-5.6(xhigh版本)花了大约684美元一次,拿到B3的40.86分;Claude Opus 5配Claude Code花了大约2728美元,也就是拿到40.70分,跟前者基本打平,但价格是四倍。而最高分那个GPT-5.6 Ultra版本要花大约1550美元一次。
论文的结论很直接:**花更多钱不一定换来更高的分数**,如果追求性价比,GPT-5.6 xhigh是当前最划算的选择;如果就想冲最高分不在乎成本,GPT-5.6 Ultra更合适。
写在后面
读完这篇论文,最让我意外的其实不是"AI科研能力还很弱"这个结论,这个大家心里多少有数。真正让我停下来想了一会儿的,是B2比B3更贵这个细节。
我们平时设计任何指导性文档、教学材料、甚至团队协作流程时,本能地觉得"给得越具体越好",哪怕给不全,多少也是帮助。但这篇论文用真实数据告诉我们,半吊子的指导可能比完全不给指导还糟,因为执行者会被框在一个不完整的框架里反复试错,既没有自由发挥的空间,也没有明确的路径可循。这个道理其实不只适用于AI,带团队、写文档、做产品设计的时候可能都得留意这一点。
另外一个没在正文细讲但值得单独拿出来的地方是,论文里B1到B2的落差远大于B2到B3。这意味着如果未来有团队想说"我们的AI已经能自主选择科研方法了",光靠B2这种"给方法不给步骤"的测试是远远不够的,真正的硬骨头在"把方法变成可执行流程"这一步,这一步现在还没人真正啃下来。
这个基准还只是个开始,60个任务撑不起全部科学疆域。什么时候能看到B3分数稳定超过80分,也许才是真正该重新审视"AI能不能自主做科研"这个问题的时候。
Q&A
Q1:ASI-Bench是什么?
A:ASI-Bench是由清华大学等机构40多位专家联合打造的评测基准,包含60个跨越11个学科的项目级科研任务,专门用来测试AI在人类指导逐步撤走的情况下,能不能独立完成从方法选择到执行验证的完整科研流程。
Q2:ASI-Bench里的B1到B4分别是什么意思?
A:这是四种递减的人类指导程度。B1给出完整的方法、公式和执行步骤;B2只给方法名称,具体怎么做要AI自己搞定;B3只给研究目标和数据,方法完全靠AI自己判断;B4在B3基础上加入干扰信息,测试AI会不会被带偏。
Q3:ASI-Bench测出来的结果说明了什么?
A:18个主流AI系统测试下来,平均分从有完整指导时的50.91分,跌到只给方法名时的29.10分,再跌到完全自主判断时的26.62分。最大的落差出现在拿掉详细步骤的那一步,说明当前AI最缺的不是判断该用什么方法,而是把方法落地成完整可执行流程的能力。






