你有没有想过,让一个AI从零开始做一次完整的科学研究,中间会出多少岔子?
不是那种简单的问答任务,而是真正的科研流程:读文献、看数据、设计实验、跑代码、分析结果、写报告。这几年冒出来的自主科研智能体越来越会干这些活了,能力越来越强,写出来的报告也越来越像模像样。但一个更深的问题浮出水面了:这些报告写得漂亮,但它们真的回答了研究者想问的问题吗?
这篇来自浙江大学等机构的论文,讲的就是这件事。
**一个开放式任务背后藏着多少没说出口的要求**
想象一下你给一个AI这样一句指令:"结合多种观测数据,测算全球冰川的质量流失情况。"
这句话听起来清楚,但它其实是一座冰山的尖角。真正要做好这件事,你得先搞清楚该用哪些观测数据来源、该用什么方法做数据融合、该跟哪些已有研究的结果做对比、结论需要什么样的证据支撑才算站得住脚。这些要求,指令里一个字都没提,但它们全都是隐含在"测算冰川质量流失"这句话背后的科学常识。
问题就出在这里。
AI智能体拿到这种模糊指令,它可能只是套用一个看起来合理的分析流程,跑出一堆数字,写一份看起来专业的报告,但漏掉了某个关键的验证步骤,或者用了不太合适的方法,又或者某个结论其实没有足够的实验证据支撑。论文里管这叫"未支持的结论""缺失的分析""错误的流程"。
这就好比你让一个新来的实习生去写一份市场调研报告,只说了"帮我看看这个产品在国内的市场情况"。实习生可能真的做了不少工作,收集了数据,画了图表,但你拿到报告一看,发现他漏掉了竞品对比,样本量太小,还把某个地区的特殊情况当成了全国趋势。不是他不努力,而是他不知道你心里那份"合格报告"的标准到底是什么。如果不把这些隐含标准提前说清楚,他只能凭自己的理解去猜,猜错了,返工的成本比一开始讲清楚要高得多。
现有的评估办法大多是"事后打分"。等AI把报告写完了,专家或者另一个AI再拿着一份评分标准去逐条核对。
这套评分标准通常叫做rubric,评分细则:一份把复杂任务拆解成若干可以独立打分的具体条目的评估工具,常见于教育和科研评估领域。
问题是,这种评分细则要么是专家手工写的,费时费力还不好扩展到新任务;要么是用AI自动生成的,但生成质量参差不齐,可能标准定得不合理,也可能压根没法验证。更关键的一点是,这些评分细则大多只在报告写完之后才登场,起的是打分裁判的作用,它没有在研究开始之前就告诉AI:你接下来该做哪些实验,该收集什么证据,怎样才算及格。
这篇论文提出的核心想法,换个说法就是:评分标准不应该只是考试结束后的判卷尺子,它应该在考试开始之前就发给学生当复习提纲用。
**先学会怎么评价,再谈怎么改进**
基于这个想法,研究团队做了一个叫AutoSciRub的框架。
这个名字直译过来接近"自动科研评分细则",它的核心思路分两步走。第一步是在AI真正动手做研究之前,先根据任务指令自动生成一份具体、可执行的评分细则,把那些隐含的科学要求全部摊开来讲清楚。第二步是拿着这份细则去指导AI的执行过程,并且在AI写出初稿之后,逐条核对哪些要求没有满足,针对性地要求AI去补救。
这套流程听起来简单,但要把每一步做扎实,里面藏着不少讲究。
先说第一步,怎么把一句模糊的指令变成一份靠谱的评分细则。研究团队设计了四个环环相扣的子步骤。
第一步叫评分细则骨架归纳。AI先只看任务指令本身,不去看任何具体的方法或数据,把指令拆解成若干个原子级的科学目标。
原子级科学目标:把一个大的研究任务拆分成不能再细分的、独立的具体子目标,比如"测算冰川质量损失"可能被拆成"整合卫星测高数据""建立质量平衡模型""量化不确定性区间"等几块。
这一步做的事情,类似于你接到一个装修任务,先不急着挑材料选风格,而是先把任务拆成"水电改造""墙面处理""家具采购"这几大块,搞清楚这次装修到底要覆盖哪些方面。
紧接着是第二步,科学文献锚定。针对每一个已经拆出来的目标,AI去搜相关的论文、方法文档、数据说明,搞清楚这个领域里通常用什么方法、什么指标、什么样的对照实验才算规范。这一步很关键,因为不锚定在真实的科学实践上,AI自己凭空想出来的"标准"很可能既不严谨也没法验证。
这一步的操作有个细节值得说一说。系统会用search工具去检索arXiv、OpenAlex、Semantic Scholar等外部数据库,但在正式采纳某篇论文之前,会先过滤掉那些跟当前任务的"标准答案论文"重名的候选文献。
标准答案论文:评测基准里预先设定好的、任务对应的真实科学论文,用来在评估阶段核对AI的报告是否准确重现或呼应了原始研究结论,但这份论文对AI本身是保密的。
这个设计的用意是防止AI偷看答案。就像考试的时候,监考老师会把跟考试内容高度相关的辅导资料收走,不是因为学生看了辅导资料就能直接抄答案,而是要确保学生真的是靠自己的推理和查证能力做出结论的,不是靠照搬现成的结果。如果不做这层过滤,AI很可能直接搜到目标论文,把里面的结论原样复制过来充当自己的研究成果,这样整个评测就失去了意义。
第三步是任务数据探索。光有文献里说的"应该怎么做"还不够,还得看看手头实际能拿到的数据支不支持这么做。AI会去检查任务提供的文件格式、字段、数据关系,确认哪些分析在当前条件下真正可行,哪些即便文献里推荐,但因为缺少某个关键变量或者标签数据而实际上做不了。
这就好比你翻遍了各种健身教程,发现专业运动员都在用某种复杂器械训练,但你家里根本没有这个器械,那这个方案对你就是纸上谈兵,得根据你实际拥有的条件重新设计计划。
最后一步叫标准合成。把前面三步的信息汇总起来,生成一份真正可执行的评分细则,每一条都明确了对应哪个科学目标、需要用什么数据源、要做哪些具体实验、用什么指标衡量、跟哪些基准做对比、需要产出什么样的图表或证据材料,以及满足这一条的判定条件是什么。
**从骨架到成品,评分细则本身也需要打磨**
研究团队专门做了一次质量评估,来验证这套逐步细化的流程到底有没有让评分细则变得更好用。
他们找了另一个AI模型作为评判,从四个维度给评分细则打分:具体性,也就是这份细则说得够不够明确、含糊不含糊;可操作性,也就是AI能不能直接照着做,不需要自己再去猜测关键步骤;证据可验证性,也就是要求的证据能不能被独立核实,是不是有具体的图表数据支撑,而不是让AI凭嘴说结论;科学核心覆盖度,也就是这份细则有没有真正抓住任务背后的科学本质,而不是跑偏到无关紧要的分析上去。
结果显示,从最初的骨架版本到最终的可执行版本,前三项指标全都有明显提升。具体性从1.65分涨到4.40分,涨幅最大;证据可验证性从1.78分涨到4.08分;可操作性从2.00分涨到3.83分。这说明整个细化流程确实有效地把一个笼统的科学方向,变成了具体、可执行、可核查的一套要求。
但研究团队也很坦诚地指出了一个反差:第四项指标"科学核心覆盖度"反而从3.35分微微降到3.07分。
这个细节值得停下来想一想。它说明AI在把一个已经确定的科学方向落实成具体操作时非常在行,但如果一开始骨架版本就没抓住真正的科学重点,后面的细化步骤反而可能在错误的方向上越做越细,把精力花在了次要或者跑偏的分析上,而不是把方向拉回正轨。换句话说,AutoSciRub擅长把"做对的事情做得更具体",但没法替代最初判断"这件事到底该不该这么做"的科学判断力,这部分能力目前还是主要依赖底层大模型本身的水平。
**报告写完了不是终点,逐条核对才是关键一步**
有了评分细则,接下来就是第二个阶段:用这份细则去指导AI写研究报告,然后再逐条检查报告有没有达标。
具体流程是这样的。AI先根据评分细则去做实验、写初版报告。写完之后,一个验证环节会拿着评分细则里的每一条,去检查报告里对应的实验有没有做、结果有没有报告、该有的图表有没有附上、结论有没有实验证据支撑。这个验证过程会区分清楚哪些证据是这次任务真正跑出来的实验数据,哪些只是引用文献里说的东西冒充证据。
如果某一条没通过,系统会记录下具体缺了什么、需要怎么补,把这些反馈整理成一份"待办清单"交还给AI,让它针对性地修改报告,可能是补一个漏掉的实验,可能是加一组对比数据,也可能是删掉一个证据不足的结论。这个过程可以反复进行,直到所有条目都通过验证,或者达到最多三轮的修改上限。
这个设计有个很朴素但很扎实的逻辑,就是把一份笼统的"你的报告不够好"变成一份具体的"你的第三个目标缺少对照实验,建议补充某某分析"。
这就好比老师批改作文,如果只写一句"内容空洞,重写",学生完全不知道该往哪个方向改,很可能改来改去还是原地打转;但如果老师写的是"第二段说你观察到了现象,但没有给出具体数据支撑这个判断,建议补充实测结果",学生就能精准地知道该往哪里发力。如果不做这种逐条拆解式的反馈,单纯让AI自己反复读一遍报告再修改,效果会差很多,这一点后面有实验数据能验证。
**验证效果的两个战场**
研究团队在两个不同的测试集上验证了这套方法,一个叫ResearchClawBench,一个叫AstaBench。
ResearchClawBench包含40个跨学科的端到端科研任务,涵盖天文学、化学、地球科学、能源科学、信息科学、生命科学、材料科学、数学、神经科学和物理学十个领域,每个任务背后都对应着一篇真实发表过的论文和一份公开数据。
在这个测试集上,研究团队做了两组对照实验。
第一组固定AI执行框架为Codex(一种代码智能体工具),只换底层大模型,分别用GPT-5.4、GLM-5.2、MiniMax-M3三种模型跑同一批任务。结果三种模型用上AutoSciRub之后,得分平均提升2.38分、1.87分、1.99分,平均提升2.08分。这说明这套方法不是只对某一种模型管用,换了模型照样有效。
第二组反过来,固定底层大模型为DeepSeek-V4-Flash,换执行框架,分别测试Claude Code、OpenClaw、OpenScience三种不同的智能体系统。结果提升幅度分别是2.14分、3.11分、3.60分,平均提升2.95分。这说明就算换了完全不同工作方式的智能体系统,这套评分细则驱动的方法照样能带来实打实的提升。
更有意思的是AstaBench上的结果。这个测试集主要考察AI在人工智能与自然语言处理领域完成从实验到报告的完整流程,研究团队随机抽取了20个任务来测试三种智能体配置:Claude Code、Codex、OpenClaw。
结果显示,三种配置的平均分分别提升了19.4分、12.6分、18.4分,平均提升16.8分,提升幅度比ResearchClawBench上大得多。而且Claude Code和Codex的成功完成任务数从18/20直接提升到20/20,OpenClaw维持在19/20但分数照样大幅提升,说明这套方法不只是让本来能做完的任务做得更好,还能帮一些原本会失败的任务真正跑通。
**分步拆解,看每一步到底贡献了多少**
为了搞清楚这套框架里到底哪一部分在起作用,研究团队做了一次层层递进的消融实验,固定用OpenClaw加DeepSeek-V4-Flash这套组合,在全部40个任务上逐步叠加各个模块。
最基础的版本,也就是完全不用AutoSciRub的原始AI,平均得分17.25分。
只加上第一步"评分细则骨架归纳",分数涨到17.61分,只涨了0.36分。这个涨幅不算大,说明单纯把隐含要求列出来,对AI帮助有限,因为它还是不知道具体该怎么做、怎么验证。
再加上文献锚定、数据探索、标准合成这三步,凑成完整的可执行评分细则,分数涨到18.31分,比基础版多了1.06分。这说明把抽象的目标落实成具体可执行的要求,确实带来了实质提升。
最后加上迭代式的逐条核对与修改,分数直接冲到20.36分,比基础版多了3.11分,是所有阶段里单步提升幅度最大的一步。
这个结果很直观地说明,评分细则光是存在还不够,真正发挥作用的关键在于把它用起来做核查和反馈,而不只是当作写作时的参考提纲。
**光是多改几遍稿子,效果和有针对性反馈完全不是一回事**
这里有个特别值得展开说的实验,研究团队想搞清楚一件事:报告变好到底是因为评分细则里的具体反馈起了作用,还是仅仅因为多给了AI几次修改的机会?
为此他们设计了一个对照组,叫"无评分细则的自我修改"。这个对照组从同样的初稿报告出发,同样用三轮修改的机会,但不给AI任何具体的评分细则反馈,只是让它自己重新审视一遍报告,自己找问题自己改。
结果差异非常明显。无评分细则的自我修改,三轮下来平均分只从18.31涨到19.08,涨了0.77分,而且中间第二轮还出现了分数倒退的情况。反观有评分细则指导的迭代修改,三轮下来稳步涨到20.36分,累计涨了2.05分,是前者的将近2.7倍。
这个对比说明了一件很重要的事:让AI反复看自己写的东西,它其实很难发现真正的问题,因为它本来就是按照自己的理解写出这份报告的,再看一遍,大概率还是那套理解方式,顶多修修语病、调调措辞。
这就像你自己写完一篇文章,自己反复读几遍,很难发现逻辑漏洞,因为写的时候你脑子里已经形成了一套自洽的叙述逻辑,再读一遍,你的大脑会自动帮你把逻辑上的坑给"脑补"圆满。但如果有个编辑拿着一份具体的检查清单来问你"第三段的数据来源在哪""这个结论有没有对照组支持",你才会真正意识到哪里站不住脚。如果不引入这种外部的、具体到条目的核查,单纯依赖自我反思式的修改,效果会大打折扣,甚至可能因为改动引入新的问题导致分数不升反降。
进一步拆解每一轮修改的贡献,第一轮修改把平均分从18.31拉到19.47,贡献了1.16分的提升,是三轮里贡献最大的一轮。第二轮、第三轮各自只贡献了0.61分和0.28分,乍看起来递减的趋势有点让人担心是不是修改的边际效益在快速衰减。
但研究团队进一步分析发现,这个递减主要是因为"及格就停"的机制在起作用,而不是后面的修改真的没用了。第一轮结束后,40个任务里已经有23个通过了验证,不再需要继续修改,只剩下17个任务进入第二轮,其中又有11个通过,只剩6个进入第三轮。对于这些仍然需要继续修改的"硬骨头"任务,每一轮的平均提升其实分别达到了1.43分和1.89分,一点都不低。三轮修改下来,40个任务里有35个成功通过了验证。
这告诉我们一件挺实用的事:大多数任务只需要一轮有针对性的修改就能大幅改善,只有少数确实比较棘手的任务需要更多轮次的打磨,而这种按需分配修改资源的机制,比一刀切地给所有任务同样多的修改次数要划算得多。
从任务和学科层面看,这种提升也不是靠一两个特别突出的案例撑起来的。40个任务里有36个报告质量比初稿有所提升,只有4个出现下降。按学科分类看,数学、地球科学、信息科学的平均提升幅度最大,分别达到4.12分、3.73分、3.32分,绝大多数学科都呈现正向提升,说明这套方法的效果是普遍存在的,而不是某个特殊领域的偶然现象。
写在后面
读完这篇论文,我印象最深的一个细节,是那张对比图。左边是标准的官方评分清单,写的是"报告里应该出现关于Floquet-Bloch复制能带的观测证据",右边是AutoSciRub生成的可执行评分细则,细到具体要提取哪个动量点的能量分布曲线、要用什么方法拟合峰型、峰间距应该对应多少电子伏特的能量差。
这个对比揭示的东西挺值得琢磨。官方评分清单描述的是"报告最终应该长成什么样",而AutoSciRub生成的东西描述的是"要产出这样的报告,你现在该做什么"。两者看起来都在说同一件事,但一个是终点的画像,一个是通往终点的路线图。这个区别,其实也是这篇论文最核心的洞见:评价标准要真正发挥作用,不能只在最后验收的时候才拿出来,它得在一开始就摆到桌面上,变成能指导具体行动的东西。
还有一个我没想到的结果是,科学核心覆盖度这个指标在细化过程中反而下降了。这说明AI在"把已经想清楚的事情做扎实"这件事上很擅长,但在"判断这件事到底该不该这么想"这个更根本的问题上,目前还没有太好的自我纠偏机制。这让我想到,或许再往下一步的研究方向,应该是在最初生成评分细则骨架的阶段,就引入某种能够倒逼AI跳出既定框架、重新审视问题本身是否问对了的机制,而不是等到细化完了才发现方向偏了。
一个可以做研究的AI和一个知道自己有没有做好研究的AI,原来是两件完全不同的事情。后者可能比前者更难,但也更重要。
Q&A
Q1:AutoSciRub是什么?
A:AutoSciRub是一个评估先行的科研智能体框架,它会在AI真正动手做研究之前,先根据任务指令自动生成一份可执行的评分细则,然后用这份细则指导AI的实验执行、结果验证和报告修改。
Q2:AutoSciRub和传统的评分细则有什么区别?
A:传统评分细则大多是研究完成后才用来打分的事后工具,而AutoSciRub生成的评分细则会在研究开始前就介入,明确告诉AI该做哪些实验、需要什么证据,全程指导执行和修改,而不只是最后验收。
Q3:AutoSciRub的效果提升具体有多少?
A:在ResearchClawBench测试集上平均提升2到3分左右,在AstaBench测试集的20个任务子集上平均提升达到16.8分,同时还提高了任务的成功完成率。







