Token导航 LogoToken导航

OpenRSI Index发布:AI评测从答题转向研发更强AI

更新时间 2026-09-25来源 ZPotentials正文 4837字阅读约 16分钟2 张图片
图片
过去几年,大模型能力最直观的衡量方式一直是Benchmark。但随着传统 Benchmark逐渐饱和,一个问题开始浮现:当模型越来越擅长“工程”,该怎么衡量它是否具备“做研究”的能力?随着 RSI(递归自我改进)推进,问题更复杂了:AI开始优化其他模型甚至自身时,谁来定义研究目标?又怎么区分真正的创新和“局部作弊”?

为应对这一挑战,近期发布的OpenRSI Index尝试将这一命题转化为一套可执行的开放实验框架。

OpenRSI汇集了来自华盛顿大学、UC 伯克利、斯坦福、普林斯顿、哈佛、MIT 等机构的研究者与顾问。其推出的OpenRSI Index,尝试把这个问题转化为一套可以实际运行、检查和复核的开放评测框架:不只让AI回答问题,而是让它进入真实的模型研发环境,尝试改进已有的人类方案。Z Potentials非常荣幸能够和 OpenRSI研究者们一起探寻AI从“会答题”走向“会研究”的能力边界,并参与此次论文工作。

答对一道题,与完成一项研究,是两件事。

一道题可以有明确的输入、边界和评分标准。但在研究中,最难的部分往往不是“把答案写出来”,而是判断问题出在哪里、什么假设值得验证,以及一次失败之后,下一步应该往哪里走。

一个模型即使在数学、代码和推理测试中拿到高分,也不能直接证明它能设计有效的实验,更不能证明它能在有限预算下,持续找到值得投入的新方法。

传统Benchmark并非不再有用,而是仅凭“答题成绩”,已经不足以回答“AI能不能做研究”。

它更接近研究过程的问题:在明确的代码、算力和实验边界下,AI能不能像研究员一样,通过连续试错,把一个真实的模型系统做得更好?

01 Benchmark测答案,科研测的是“如何抵达答案”

传统Benchmark的一个重要优势是可控。输入确定,输出确定,评价指标明确,不同模型可以在完全一致的标准下比较。这种标准化推动了过去几年大模型能力快速迭代。

在实际的机器学习研发中,问题往往极度模糊:训练Loss停滞,可能源于优化器、数据配方、学习率甚至隐蔽的Code Bug;一次小模型上的性能提升,未必能扩展至百亿参数;而每一次验证都伴随着显存、算力与时间的真实消耗。研究员的核心价值,很大程度上体现在如何在庞大的搜索空间中权衡试错成本,判断下一个GPU小时最值得花在哪里。

OpenRSI试图将这种真实的“资源约束”重新引入评测。全面还原真实科研任务的复杂性与约束边界。评测任务覆盖预训练(Pre-training)、后训练(Post-training)与图像生成等核心领域,并严格引入了现实工业级的工程约束。

在算力与工程层面,官网列示的单次运行规模包括Marin-Scaling-Ladder的 18432 H100 GPU小时、Qwen-122B-RL-Merge的20864 H100 GPU小时,以及GPIC 的 5815 H100 GPU小时。需要特别说明的是,GPU小时统计的是所有卡的累计用量,并非实验经过的绝对时长。

仅构建OpenRSI-Index v0.1预览版,就已投入超过100,000 H100 GPU小时,并包含持续60小时以上的Agent研究轨迹。评测由此进入真实科研的时间尺度:Agent需要连续提出假设、运行实验、解释失败,并决定下一轮尝试。

在任务场景层面,评测横跨基础大模型、具身机器人控制、计算机视觉、长文本检索、复杂逻辑推理以及底层系统性能优化。

当答案本身不再是唯一的评价标准,研究路径本身便成为了评测对象。OpenRSI 拒绝“只看结果”的黑盒打分,而是按任务规定的主要指标选取有效提交,同时完全公开研究全过程中的运行轨迹。研究者可以清晰地审查:AI如何提出科研假设、如何根据中间结果调整方案、又如何在严苛的成本约束下决定下一步决策。这些完整的轨迹记录,让一个更低的Loss有了可以追溯与复现的真实实验背景。

02 当实验被自动化,谁来定义下一个值得研究的问题?

一旦AI拥有更多自由度,如何防止“为了得分而优化评测”会变得更加重要。这几乎是所有自主研究系统都会面对的问题。

一个模型可能确实找到了更好的训练方法,也可能只是碰巧找到了某种评测漏洞;它可能改善了真正的泛化能力,也可能只是在有限环境中对验证集进行了隐性过拟合。对于人类研究者来说,这对应的是科研中一个非常熟悉的问题:结果能不能复现?所以,一次“涨分”通常只是研究开始,而不是研究结束。

为了解决不可复现与数据污染问题,OpenRSI在工程上做了非常严苛的隔离设计——把执行实验和最终验收完全拆开:

  • 基线对照机制:原作者发布的基线方案会在完全相同的任务环境中重跑,作为底层对照。

  • 状态冻结与独立沙箱:Agent可以在自己的工作区里不断修改代码和运行实验。但当发起提交时,系统会立即暂停工作区并保存快照(Snapshot),然后在一个新启动的、完全独立且干净的评测环境里重新执行验证。

  • 数据隔离与硬性惩罚:私有测试数据不会暴露给执行研究的Agent,评测环境中的信息也不会重新流回研究工作区。篡改奖励机制、获取隐藏评测信息、突破预设资源限制等硬性违规行为,将直接按规则计零分。

明确的约束与独立验收机制,为AI的研究结果提供了坚实的可检查基础。一次有效提交能说明什么,仍然取决于具体任务、算力预算与评价标准;它并不自动证明方法能无缝迁移到所有规模和场景,但至少保证了每一次微小的进步都是真实可信的。

最近一轮AIScientist、自动研究Agent和递归自我改进讨论中,一个越来越重要的方向,是把注意力从“AI能不能提出伟大理论”,转向一个更现实的问题:科研流程中,到底有哪些部分可以首先被自动化?

答案很可能是实验。今天机器学习研究中存在大量高度工程化、同时又高度消耗时间的工作:修改一个参数,训练几个小时;更换数据配方,再重新比较;一次实验失败之后检查日志,然后重新设计下一组对照组。

这些工作并不简单。相反,它们需要大量经验判断。但它们同时拥有几个天然适合Agent的特征:反馈相对明确、实验可以重复、评价指标可计算,而且大量尝试可以并行展开。这恰好是AI最可能首先改变科研生产方式的地方。

更进一步,OpenRSI希望把有影响力的开源项目都转变成Autoresearch环境,让Agent去发现性能的边界。

以Kev(Open-Jev-Training)任务为例,Agent需要在固定训练数据上,改善一个直接输出决策的小型神经模型的决策质量与置信度估计。图中,两条运行轨迹的决策概率评分分别达到0.29233和0.28955,高于0.25186的基线。每次提交的得分、被拒绝的提交,以及截至当时的最佳结果,都可以沿时间轴查看。

图片

OpenRSI官方在解释RSI时提出一个判断:限制研究进步的资源不仅是算力和数据,还有“insight bandwidth”——研究者产生、验证和执行想法的带宽。Agent 的潜在作用,是同时扩大想法生成和实验执行的搜索范围。

OpenRSI选择将任务定义、评测框架、验证工具以及所有探索轨迹彻底公开,其背后的目的非常直接且具体:

  • 对拥有充沛算力的顶尖团队而言:可以无缝复用这套基准环境,复核与检验已有的RSI实验结果,并沿着已有轨迹探索更前沿的算法假设;

  • 对缺乏大型集群的小团队与个人研究者来说:不必陷入算力焦虑,直接通过公开的运行轨迹,清晰地观察AI改了什么代码、在哪里遇到了瓶颈、哪些技术方向尚未走通,把前人留下的实验记录作为下一次探索的起点。

在科学研究中,一次失败的实验并不足以证明某个方向是绝对的死路;相反,一份完整的实验轨迹与失败记录,能够帮助后来者精准判断哪些条件值得改变、哪些尝试值得继续。

当Agent可以连续运行几十甚至上百次实验,比较不同假设,并根据结果修改下一轮方案时,人类研究者过去大量用于“试错”的时间,有可能被重新释放出来。

科研工作因此可能出现一种新的分工:人类更多负责提出值得研究的问题、构造评价体系和判断研究意义;AI则负责扩大实验搜索空间,把大量候选路径快速跑出来。至少在现阶段,这可能比“AI独立成为科学家”更接近正在发生的变化。

03 当AI坐上实验台:RSI会是科研范式的终极答卷吗?

顺着技术演进的脉络继续向深处看,OpenRSI最终指向的,其实是一个比单纯 Benchmark更大的产业命题:如果模型A可以被优化为A+,那么A+能否进一步参与下一轮研究,并产生超越上一轮的方法?

这正是递归自我改进(RSI)最具想象空间、也最缺乏实证的环节。理论上的 RSI是一个自我强化的闭环:更强的模型产生更好的研究能力,进而驱动下一代模型的迭代。一旦这个循环持续成立,AI的演进速度理论上将不再受制于人类研究者的物理极限。

然而,绘制循环图景容易,让它持续运转却极其困难。第一次改进可以依赖设计良好的Benchmark,但当已有测试集被优化到极致,谁来发现下一道真正重要的科学问题?这正是刷榜与科研的本质分界:刷榜是在已知坐标系中寻找更高分,而科研是在决定下一个坐标系应该如何建立。这恰恰是科研中最难被自动化的一环。

这也解释了为什么OpenRSI必须将开放社区作为整个RSI体系的核心一环。RSI 的进步建立在研究者、独立实验室与领域团队积累的方法、代码和经验之上,其收益也应回到共同建设它的人手中。OpenRSI希望通过共享工具与研究环境,让更多人参与定义问题、制定评估标准,并分享新的方法与发现。随着Agent承担更多实验探索,研究者也可以把更多精力投入更大胆、更有价值的问题。

对于自主科研而言,开放的价值不仅在于公开代码,更在于让结果能够被检查、方法能够被复用、新问题能够由更多人提出。为了将这种协作转化为具体的实验基础设施,OpenRSI推出了RSI-Anything:

  • 贡献者仅需一小时和Agent的交流,即可设计一个RSI的环境;

  • 随后,任务经过运行与科学性审阅并被接纳后,贡献者会获邀成为共同作者;

  • 同时,团队也在持续吸引算力伙伴,以及基础模型、生物医药、法律、3D视觉、科学计算等领域的负责人与领域专家加入。

以RSI-Anything为代表的尝试,其意义不仅在于让AI解题,更在于探索如何将真实的科研课题转化Agen可运行的标准化环境。通过将基础模型、医疗、法律、3D视觉及科学计算等垂直领域的真实项目转换为结构化的实验空间,人类研究员得以将研究目标、限制条件与评价标准打包下发。

科研正在演变为一种全新的生产系统:人类负责决定“什么值得被认知”,AI则负责将“如何去验证”的时间成本压缩至极致。

作为一个仍处于Preview v0.1阶段的早期项目,当前的OpenRSI远不足以证明 RSI闭环已经成功建立,但它所代表的行业风向切换极为明确:评估范式正在从“模型能否比人类更好地回答一道定义好的题”,转向“在给予代码、算力、预算和目标的前提下,AI能否自主探索出一条更优的研究路径”。

当下,AI距离成为真正意义上的研究员仍有长路要走,但它已经切实坐到了科研人员的实验台前。

Z Potentials也将持续参与这一方向的研究交流与社区协作,连接更多研究者、技术团队与领域问题,共同探索AI自主科研的能力边界。欢迎与Z Potentials合作,一起探索AI如何参与真实科研。无论你的研究方向是大模型、机器人、AI4Science、计算机视觉,还是其他具有明确实验与验证需求的领域,我们都期待听到你的问题:你的研究中,哪些环节最耗费时间?哪些想法一直缺少机会验证?哪些任务,值得交给AI Agent挑战?

你可以带来一个真实的研究课题、一套已有的实验代码,或一个尚未验证的想法。我们希望与你共同探讨OpenRSI任务设计、科研Agent评测与跨领域研究合作,让更多来自一线科研的问题,成为推动AI研究能力进步的起点。

下一代科研工具如何被定义,需要真正理解科研问题的人一起参与。

让AI做研究的第一步,不是宣布它已经成为科学家,而是让它的每一步进展,都经得起科学的检验。

文章标签学术研究算力
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多