Token导航 LogoToken导航TokenDH.com

人类造的最后一代AI!上交清华字节75页综述拆解RSI路线图

更新时间 2026-09-16来源 智猩猩正文 3691字阅读约 12分钟7 张图片

智猩猩AI整理

编辑:金水

人类可能正在造最后一代“亲手打造”的AI。

最新一篇来自上交、清华、字节、上海AI Lab等团队的75页综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,把一个被讨论了很久的问题,重新拉回到了一张可以检验的路线图上:AI究竟什么时候才算真正开始自我进化?

围绕这一问题,这份 75 页的综述回顾了 491 项研究,研究团队将其概括为一句话"我们提出了一张以自主度为中心的递归自我改进路线图"。

图片
  • 论文题目:

    The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement

01

什么是递归自我改进 

论文将 RSI(Recursive Self-Improvement,递归自我改进)定义为一个智能系统通过与任务、环境或其他智能体的持续交互,自主地将获得的经验与反馈转化为对自身持续的改变(模型参数、agent 脚手架、改进策略等),并且这些改变能够反作用于"后续如何生成、评估、筛选与整合下一次自我改进"。经过改进的系统携已变化的能力状态,重新进入下一轮交互与改进。

换言之,RSI 的目标并非仅在单次任务中表现更优,而是将"如何变得更好"这一过程本身纳入优化对象。

RSI 不在于某个具体的学习算法,也不在于一次性的优化结果,它同时追求三个维度。

(1)自主性,是系统承担的责任从"执行别人指定的更新"一步步扩大到"自己发现短板、提取经验、提出改动、验证并保留成果";

(2)效率,是用更少的数据、算力、推理、人工评审和返工,拿到更多被验证过的改进;

(3)创新,则是能搜索到人类没规定过的更新策略,并把有用的发现喂回后面的改进轮次。

整篇综述据此画出一张路线图:从改进执行自主,到改进策略自主,到学习经验获取自主,到环境适配自主,最终到递归元改进,让"改进机制"自己也被改进。

图片

02

解剖一个"改进循环" 

理解 RSI,关键不在某一算法,而在"改进循环"(improvement loop)这一基本分析单元。

一个完整的循环由系统、被继承的状态、从交互中获得的经验、被修改的目标、生成候选改动的改进器、决定搜索方向的策略、判定候选是否通过的验证器,以及通过验收、携带更新状态进入下一轮的后继者共同构成。

判断一个系统是否真正具备 RSI,核心在于两点:围绕系统本身的自我改进循环是否持久形成,以及系统对循环本身掌握了多少内生话语权。

论文进一步区分"结构性递归"与"有效性递归":前者指被改写的改进机制确实作用于下一轮;后者指在同等预算与独立评测下,该机制真正筛出或造出了更强的后继者。仅有结构上的递归,并不等于系统真的在变强。

03

自主度五级框架  

论文依据"AI 在自我改进中承担责任的程度",将现有工作划分为五个层级(另设一个参照级 B0):

图片

B0 到 L1 看有没有"持久化",改完能活过当前任务,才迈进 RSI 的门(Self-Refine、Reflexion 只在当次会话里打转,FineWeb-Edu 用模型给人定的"教育质量标准"打标签、大规模保留);

图片

L1 到 L2 看谁选"改什么",L1 还是人定方案、AI 跑流程,L2 的 GEPA 会用执行轨迹定位失败模式、自己提修改方案,相当于把"经验研究员"那部分活儿部分自动化了;

L2 到 L3 看谁定"学什么",AZR、R-Zero 让任务难度跟着学习者走,你弱在哪,下一波练习就往哪打;

图片

L3 到 L4 看改进能不能落到部署环境里,PANDO、Metis 把交互经验蒸馏成可复用技能、可调用的代码工具,在真实任务里持续适配;

L4 到 L5 看改进机制本身能不能被改,STOP 把自己那段"优化器代码"当优化目标,A-Evolve-Training 在 30B 模型上自主后训练,研发分上去了但外部分没跟上,就反过来改研究策略。

图片

论文特意提醒,级别更高不等于改进更好。更大的自主权,可能同时带来低效搜索、不可靠反馈、能力回归、钻验证器空子、迁移性差。所以"AI 接管了多少责任"和"改进过程的质量与效率"必须分开看。

如果非要挑一个最能体现这条终局路径的现成系统,论文反复点名的是达尔文-哥德尔机(Darwin Gödel Machine, DGM):

它能改写自己的代码、跑测试验证改动、把成功的版本留下来,并通过一套受达尔文进化论启发的过程不断生成新的"后代"。它不再只是被人推着"更新",而是开始靠自己"演化",这恰好就是 RSI 想走到的地方。

04

怎么运行:

落到四个领域与六家工业实践    

论文将框架置于真实场景中检验,不同领域的反馈条件差异显著,RSI 所呈现的形态亦有所不同。

科学(S1)目标开放、实验成本高、反馈稀疏,当前最强仅达 L2;具身智能(S2)依赖环境-课程共演化(POET、EnvGen),ENPIRE 已令编码 agent 修改机器人策略,逼近受限 L5;

软件工程(S3)反馈信号最为丰富且成本低廉,L2 最为成熟,DGM 借助种群档案达到受限 L5;医疗(S4)不允许随意试错,L2 是主要应用场景,纵向数据支撑的 L4 与 L5 尚属空白。

工业侧,最前沿的自我改进循环往往率先显现于企业工程管线:

Theseus 实现环境-数据-模型共演化,环境重构后评分提升 18.65–39.67 个百分点;Lark 将协作数据持续结构化,可用性评分从 52% 提升至 65%,并始终保留人在环;

图片

Humanlaya 跨批次更新质检系统,关键缺陷包比例从 9.0% 降至 3.7%;ModelBest 令 AI 从零自主构建生产级实现,约 1.5–2.5 天反超基线;

腾讯混元 Hyra 以"经验银行"留存解法与验证反馈,当验证器被策略性利用时进一步修订验证机制本身;Agent-Native 的 ARA 对推理全过程留痕,问答准确率达 93.7%(传统论文仅 72.4%)。

05

怎么判断它是真改进还是假象  

论文花大量篇幅讲"怎么评",因为 RSI 最容易翻车的地方就在验证,它点出三个绕不开的难题。

安全继承:改动要跨轮持久,但持久不等于持续变好,Gödel Agent 改写自己的策略和逻辑,100 次 MGSM 优化里有 14 次还不如初始策略,需要迁移测试、版本历史和回滚机制来兜底。

自主权归因:生成了更好的候选,不代表它改进了"怎么发现候选",达尔文哥德尔机把编程 agent 从 20% 提到 50%,但它的档案维护和父代选择规则并不在自修改范围内,得把"AI 掌控的决策"和"固定搜索流程/人工验收"分清楚。

可靠验证:反复访问验证器会诱发钻空子,Anthropic 的自动研究实验里就出现过随机种子挑拣、试图抠测试标签,RQGM 的解法是 epoch 内冻结验证器、用独立锚点审替换。

所以评估不能只看"这一轮任务分高不高",而要同时看:跨轮是否真的增益、能力有没有被 displace、留出的任务上能否迁移、单位算力和人力成本多少、有没有有害更新、机制本身有没有被复用。

论文还建议区分"结构性 L5"(机制被继承并调用)和"有效性 L5"(它真造出更强后继者),并用冻结机制、留出任务、匹配预算的对照实验来验。

06

未来方向 

综述在结尾列了八个方向,核心是把零散进展连成"可持续的递归改进"。这八条覆盖从诊断到落地的全链路:

跨组件诊断要求做可控对照、分清"真修好"还是"补偿了上游缺陷";学习者条件化的经验获取要让经验同时管住有效、难度与效用,别让自适应课程反复挑模糊任务;

持久状态管理得给每个继承物贴证据与适用条件,防止技能没被检索到、没被忠实执行或库漂移劣化;领域特定的受治理适配需要判别 transient 失败与反复性局限并分级验证;

改进机制的可信演化要在改验证器或策略时保持独立验收、检测"提议者-验证者"合谋并能安全回退;继承能力的长程评估要把结构性递归与有效性递归分开验,看增益是否触顶、加速是否靠堆算力;

资源感知的人机协作要算清从诊断到部署的总预算,该停就停、该交人交人;跨轮继承的可复现基础设施则用统一工件格式携带父状态、改动、动机证据与验收决定,让后继系统知道改进到底怎么来的。

真正的 RSI,证据应是"可重复、可归因、可迁移"的,继承下来的改动,要真的帮后续轮次获得更有用的经验、发现更好的干预、更可靠地筛出后继者。

07

总结  

这篇综述给 RSI 画了一张以"自主度"为中心的地图:从 B0 的任务内打磨,一路到 L5 让改进机制自己也被改进。

它以"改进循环"为分析单元,厘清了系统改了什么、后继者继承了什么、哪些决策仍握在人手里,并把这套框架接到科学、具身、软件、医疗四个领域,又用工业实践和初步实证把路线图钉在了真实能力上。

现在大部分系统还停在 L1–L3,L4 只在部分仿真里出现,端到端的 L5 仍集中在受限原型和早期工业系统里。更大的自主权本身不等于更好的改进,能不能在明确的资源和人类监督约束下,拿出可转移、可验证的持续增益,才是判定"真 RSI"的硬标准。

也许人类造的最后一代 AI,不只是某个具体模型,而是第一套能自己把自己越改越好的系统。在那之前,我们还有八条难路要趟,和一堆必须守住的人为边界。

说到底,当 AI 不再只是被我们"更新",同时需要开始自己"演化",人类亲手造模型的日子,或许就走到了尽头。

文章标签应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多