Token导航 LogoToken导航TokenDH.com

都在说RSI,那「递归自我改进」现在走到哪一步了

更新时间 2026-09-18来源 AI修猫Prompt正文 7657字阅读约 24分钟30 张图片

AI造AI这句话已经被重复了很多年,随着近期顶尖实验室对自动化研发(AI-for-AI)的密集下注,一个原本偏向理论探讨的概念,递归自我改进(Recursive Self-Improvement,RSI),开始被赋予清晰的工程落地意义,并迅速推向大众视野。

通俗来说,过去的AI变强全靠人类喂数据、写代码,而RSI是让AI自己把犯过的错、踩过的坑,转化成持久积累的技能与架构更新,再用升级后的自己去推动下一轮更强的进化。如果这条闭环跑通,模型研发将摆脱数万专家工时的试错瓶颈,在科学计算、复杂软件工程等超长链条领域真正释放出全自主进化的生产力。

图片

上交大等机构最新的这篇综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》把「改进回路」本身当作分析基准,梳理出一张从执行自治到元改进的五级能力地图,并横跨科学、具身、代码与医疗四大场景测出了真实的水位线。这篇近八十页的硬核长文门槛极高,本文替你省去繁复的学术考据,直接抽离出它的核心骨架:先带你读懂作者用来对齐异构评测的核心度量衡,

通过清洗各家基准(Benchmark)的共识跑分与归一化计算,用最客观的真实数据,看清RSI当前的技术瓶颈与演进方向。

图片

为什么改进本身成了瓶颈

综述从模型开发的现实负担写起。规模在扩张:Kimi K3与Qwen3.8-Max的参数规模分别达到2.8万亿与2.4万亿,各自支持约一百万token的上下文窗口。开发过程本身也在膨胀:OpenAI报告,在GPT-5.6之前的六个月里,投入内部编码推理的研究算力份额增长约100倍,内部agentic token使用量增长约22倍。

研究者把这种负担拆成三个阶段的三类问题。第一类是基础模型训练本身的资源密集:数据准备、架构设计、分布式优化与评测彼此耦合,数据质量与数量同样吃成本,例如OpenAI的GDPval用了1,320个专业任务、约9,240个专家小时。第二类是反馈与学习环境的扩容:合成数据与强化学习自动化了一部分能力开发,却带来生成与评估经验的新基础设施需求。第三类是部署后的反复适配:线上系统不断遇到新文档、新工具与不完整上下文,工程师要手工定位失败、改检索与工具接口、维护状态并重跑回归测试。

图片 这三类问题的共同点是,改进仍是一连串昂贵且由外部协调的干预。RSI想问:这段协调里有多少可以变成被改进系统自身的持久能力。研究者的定义是,RSI是一个自主闭环过程,AI系统识别自身局限、开发并验证改进,再用由此获得的能力去改进「改进过程」本身。这里的关键在于第二半句:不是某个更好的结果,而是产生结果的机制也被改了。

训练数据流水线六个环节从人工主导(M)、人在环(H)到自动化(A)的定性进展;论文强调环节自动化与「学习者反馈反过来重塑经验获取」是两件事

尺子:HCI与它的四个公式

在聊“AI怎么自我改进”之前,必须先回答一个很多人常有的困惑:许多大模型今天号称拿下奥数,明天号称通过司法考试,它们到底是真的全面进化了,还是在挑偏科的Benchmark给我们看?

要摸清底细,就得有一把统一的尺子。但现实中各个评测考试的满分标准、题目难度千差万别,直接比分数就像拿“高考满分750”和“托福满分120”放在一起算平均分一样荒谬。为了解决这个问题,研究者设计了一套衡量指标,HCI(Headroom-Closed Index,剩余空间关闭指数)

简单来说:HCI不看你Benchmark多少分,而是看你把“剩下的提分空间”攻克了多少。

比如某项考试,在刚推出大模型那年最高分就已经有80分了(基准起跑线),满分是100分,剩下可供提升的空间只有20分。如果今天的最新模型考到了90分,相当于在这20分的剩余空间里解决了10分,那么它的HCI就是50%(关闭了一半的剩余空间)。

这套标尺由四个递进的数学公式构成:

1.挤干水分:加权共识分(Consensus Score)

不同机构对同一模型的测试结果经常互相冲突,厂商自报的分数更往往带有水分。研究者首先将同一评测协议与版本下的结果聚合成“协议链族”,并计算加权共识分:

图片
  • 公式含义s_{imbh} 是第 i 个来源对模型 m 在基准 b、协议 h 下给出的分数;\widetilde{w}_i 是来源权重。

  • 计算逻辑:为抑制虚高战报,官方榜单权重最高(基准方榜单为3,第三方独立通用框架为2.5,综合报告为2,模型方自测表格仅为1);若采用厂商自报值,还会额外乘上0.75的惩罚折损。所有后续分析,都建立在这套清洗后的客观共识分之上。

2.拉齐起跑线:剩余空间关闭指数(HCI)

统一输入后,必须解决不同考试难度与量纲不一的难题。HCI的核心逻辑不是看AI考了多少分,而是看它把“原本还没攻克的提分空间”消灭了多少:

图片
  • 公式含义F_{b,0} 是该基准进入统计第一年时模型的90分位最高表现(即“入场起跑线”),100代表理论满分;H_{mbh} 即为归一化后的HCI。

  • 计算逻辑:如果某项测试一诞生时前沿模型就能拿80分(F_{b,0}=80),意味着留给后人的改进空间只有20分。若新模型跑到90分,相当于攻克了这20分空间里的一半,其HCI即为50。通过这种方式,H_{mbh}=0 锚定入场基准,H_{mbh}=100 代表彻底封顶,异构的评测被拉平到了同一个百分制进度条上。

3.宏观画像:领域前沿轨迹(Domain Trajectory)

单个基准容易产生偶然波动。为了看清宏观趋势,论文将各细分基准按年汇总成领域维度的整体前沿轨迹:

图片
  • 公式含义\mathcal{B}_{d,y} 是领域 d 在第 y 年可用的基准族集合;Q_{b,y} 是该基准当年的90分位HCI前沿;n_{b,y} 是参评该基准的不同模型数量。

  • 计算逻辑:权重采用模型数量的平方根 \sqrt{n_{b,y}}。这样既让参评充分、受业界公认的成熟榜单拥有更大发言权,又避免个别超大测试集完全绑架该领域的整体走势。结合年度增量 图片,便能精确捕捉各领域是正在加速冲刺,还是陷入停滞。

4.假设性推演:短板优先的终点假说

在描摹出2023至2026年的实际历史走势后,论文在2026年之后画出了一条延伸的端点虚线,用以形式化表达一个关于“自我改进潜力”的理论假设:

图片
  • 公式含义T_{d,2026} 为2026年该领域的实际轨迹值,R_d 为设想的端点水平。

  • 计算逻辑:这个等式本质上假设了一个“自适应补短板”机制——即新增的改进增益并非平均撒网,而是有78% 会精准流向尚未被攻克的剩余空间(100 - T)。剩余空白越大的领域,获得的补偿性增益就越大。需要注意,公式 (4) 不是被实验证实的拟合预测,而是作者用来展示“闭环纠错如果起效,最应该在哪里带来质变”的理论假想。

将这套计算规则代入2023至2026年间近四百项前沿模型测试后,论文最终绘制出了下面这张十个能力维度的宏观轨迹图。图中每一条曲线都直观呈现了不同领域的推进速度:实线部分记录了真实的进展分化,而2026年后的带阴影虚线,正是公式 (4) 假设在引入RSI辅助后可能迎来的大幅补齐。

图片

十个能力领域的HCI年度前沿轨迹,0为基准入场年前沿、100为满分;虚线表示网络安全基准子集或pass@1口径变化,2026年之后为借助RSI的说明性外推

从这张图的走势中,可以清晰看到当前大模型能力的结构性割裂:高等数学与研究生科学等“静态答题”维度的HCI已经逼近85分以上的高位,增长曲线明显放缓;而软件工程(52.6)、终端搜索(56.8)以及工具智能体(仅39.9)等需要真正动手干活的交互领域,依然横亘着巨大的落差。

这就是为什么在讨论路线图前,必须先看懂HCI的原因:

靠人类工程师手工写Prompt、喂静态题库的传统方法,已经把AI的“答题”潜力榨得差不多了;而真正能解放生产力、让AI去写工程代码、操作复杂软件的“交互能力”,依然留着巨大的鸿沟。

这种在动态环境里不断碰壁、尝试、排错的任务,靠人类在外面一场场盯着调参根本救不过来,必须让AI具备在交互中自己发现错误、自己生成经验、自己更新自己(RSI)的能力。

把「改进」拆开:九个部件与三个问题

有了测量层,研究者转向概念层。他们不把某个算法当分析单位,而是定义一条改进回路:AI系统用经验提出对某个目标的修改,按接受规则评估候选,把被接受的变化保留进自身状态,并从更新后的状态开始下一轮。回路包含九个部件,您理解它们之后,这张地图的每一级都能被问同一个问题。

  • AI系统:跨改进周期被追踪能力状态的完整计算实体。
  • 系统状态:一轮结束时保留、被下一轮继承的部分。
  • 经验:从先前交互中获得、用于指导后续修改的信息。
  • 目标:本轮被直接修改的对象。
  • 改进者:把当前状态与可用经验转成候选修改的机制。
  • 策略:改进者决定往哪里搜索、如何生成候选的方法。
  • 验证器:评估候选并执行接受规则的机制。
  • 改进:通过接受规则、被保留并进入下一轮状态的候选修改。
  • 后继者:继承了一项或多项改进、带着更新状态进入下一轮的AI系统。

这套拆解导出三个贯穿全文的问题:回路在哪里闭合;第一,改了什么?第二,又继承了什么?第三, 哪些决定仍留在外部?研究者用它们区分「看起来在自我改进」和「真的在自我改进」。同一部件被修改的系统,可以把非常不同的决定权交给AI,所以按更新对象分类(改提示词、改记忆、改代码)不足以下判断。

在此基础上,RSI的定义被收紧:系统要能通过持续交互,把经验与反馈自主转化为跨轮的持久自更改,并且这些更改要能进一步影响生成、评估、选择与整合后续自我改进的机制。研究者还把它与三个邻近范式划清界线:持续学习通常固定学习目标、更新规则与接受检验;AutoML与智能体式机器学习会搜索模型、流程或智能体设计,但搜索空间、目标、预算与评估器一般由外部事先给出。研究者用八项特征对比四者,结论是:只有当被验证的更改跨任务持久保留,并影响后续改进如何产生或选择时,自动化才接近RSI的边界。

图片 这里有一个容易被忽略但很关键的分辨:结构性递归有效性递归。前者指被修订的改进机制确实被后续轮次继承并调用;后者指在可比预算与独立评估下,这个机制真的产出或筛出了更强的后继者。任务分数变高不等于后者成立,这个区分后来反复出现在论文的L5一节与挑战部分。

RSI与持续学习、AutoML、智能体式机器学习的八项特征对比;RSI一列在跨轮学习、持久保留、系统自我修改、候选提出、更新验证、后继者再入、机制修订与机制复用上均成立

五级地图:从执行自治到元改进

研究者按「AI把多少改进责任内化」把系统分成五级,外加一个参照级。判据不是模型能力,也不是自动化组件的数量。

  • B0(任务内改进,非RSI参照级):只在当前任务内反复修改、验证或筛选输出,不把更改保留为未来的系统状态。定义特征是「输出变了,系统没变」。

  • L1(改进执行自治):人指定改什么、怎么改、什么算成功,AI执行候选更新,且被接受的结果保留并在后续任务中复用。

  • L2(改进策略自治):目标、任务边界与评估标准仍由外部固定,但AI诊断弱点并自主决定如何改进系统。

  • L3(学习信号或经验获取自治):系统进一步决定下一轮改进需要什么经验,让关于学习者自身的证据去影响接下来学什么。

  • L4(环境适应自治):改进回路利用部署交互来修订持久状态,接受与治理规则仍在外部。

  • L5(递归继承自治):系统持久地修订支配后续改进的机制,例如改进者、验证器或后继者生成流程。

 相邻两级之间的边界可以压成五句话,这也是这张地图最可复用的部分:B0到L1是持久化,被接受的变化必须活过当前任务;L1到L2转移的是策略选择,AI决定尝试哪个干预,而不只是执行规定动作;L2到L3加的是学习议程,不断变化的学习者影响下一份经验的获取;L3到L4把反馈过程延伸到部署与环境交互,更改必须在变化的运行条件下仍然有用;L4到L5引入递归继承,负责后续改进的机制本身成为被改进对象。

五级RSI自治度地图与代表系统,自治度从L1执行既定改进逐级扩展到L5元改进,并标出各应用领域所处的位置

 研究者在跨级综合一节明确了一个限定:更高的自治级别本身不等于更好的改进过程。更大的授权可以与低效搜索、不可靠反馈、能力回退、评估器被利用或迁移失败共存。因此他们始终把「内化的责任范围」与「改进的质量和效率」分开陈述。就证据分布而言,初中级由相当多的系统支撑,L3与L4更依赖具体领域,而端到端的L5证据集中在有边界的研究原型与新兴的产业系统上。

五级回路的形态对比;灰色虚线框是仍由人控制的部件,橙色描边标出每一级新被内化的那个部件

(a) L4在固定的改进过程内吸收环境反馈;(b) L5诊断并修订改进过程本身、把经验证的变化交给后继者;元层面可修订的是后继者生成、候选评估与研究控制,而任务、安全边界、受保护评估与最终验收仍在人手里

四个应用场景:反馈决定路线

同一套回路放在不同领域,差别主要来自验证一项改进需要什么反馈。研究者选了四个场景,因为它们代表四种反馈机制。

科学、具身智能、软件工程与医疗的差别在于验证并继承一项改进所需的反馈不同,共同瓶颈是可用于持久继承的安全证据;图中标出各场景当前最强的一级

  • S1科学:探索开放,实验昂贵,失败不指认原因(可能是假设错、协议错,也可能是仪器不稳),结论的有效性还依赖假设、领域与测量流程。

  • S2具身智能:经验是内生的,当前策略决定能到达哪些状态;能力分布在感知、规划、控制与本体上,难以归因到单一模块;物理试验不可随意复现或回滚。

  • S3软件工程:产物与开发它的智能体都是可执行代码,反馈便宜且可执行,但测试通过仍受限于规格与覆盖率。

  • S4医疗:不允许无约束试错,临床反馈延迟、异质且混杂,改进还可能在人群与机构之间不可迁移。

研究者对每个场景都给了同一组判断:目前最强的一级在哪里,哪些还只是提案。科学的现状是L2最强,少数系统展现L3的跨任务经验复用,端到端L4与L5基本未被探索。具身智能同样是L2为主,L4的智能体与环境共同演化主要出现在仿真中,个别系统接近有边界的L5。软件工程里L2是最成熟的等级,L4环境适应基本缺席,L5只出现有边界特征,完整改进「软件开发改进者」本身尚未被展示。医疗的L2最强,L4与L5大多未被触及。对您来说,这张表的用途是判断一个自称「自我进化」的系统究竟停在哪儿。

产业层的初步实践:六个案例与它们的分寸

论文特意把产业材料纳入证据范围,理由是许多前沿改进回路先出现在技术报告、工程博客、开源仓库与产品基础设施里,而不是先出现在学术论文里。以下六个案例来自公司或团队的自述,研究者把它们与学术文献并列,但读者应把它们读作可行性证据,而不是独立复现的实验结果。

  • Theseus:把环境、数据与模型放进同一个共同演化回路,先训练环境细化模型,再用重建后的环境暴露真实能力缺口并生成训练数据。早期实验里,八个前沿模型与框架组合在30个工作任务、1,280条评分项上,干净工作区相对噪声工作区的通过率高出21.7到51.6个百分点;在固定模型与框架的条件下,由Collection Map与Event Log组成的重建环境把总分抬高18.65到39.67个百分点,同时出现了少数「范围蔓延」式回退,即改动比任务要求更大。 

    Theseus的四阶段共同演化回路:重建环境、发现困难案例、训练任务模型、演化环境,并由环境细化经验训练环境细化模型

  • Lark:从企业协作数据里持续构建知识图谱,并把数据生产、质量评估与失败归因当作RSI的地基。它报告人工评定的任务可用性从52% 升到65%,自动评估可用性从47% 升到56%(相对RAG基线),自动评估器与人工判断的一致率约84%,且偏差多数来自自动评估更严格。 

    Lark的数据地基回路:采集协作数据、组织数据、评估质量、构造反馈,再由真实工作中的智能体改进反哺下一轮迭代

  • Humanlaya:数据质量保障场景里分成内环与外环,内环修当前批次的数据,外环修「检查与修复的方法」,把规则、提示词、少样本示例与技能当作持久改进对象。四个反馈驱动的版本迭代后,在600个未参与更新的任务包上,含关键缺陷的包从9.0% 降到3.7%,平均人工处理时间从48分钟降到27分钟。 

    Humanlaya的交付驱动回路,内环改进当前批次的数据,外环更新「检查与修复的方法」,真实使用反馈与验证闸门连接两环

  • ModelBest:主张AI工程会比开放式研究更早自治,并把「从空目录出发交付一个可运行的训练实现」做成端到端范式。其ForgeTrain在H100上约8小时追平Megatron-LM v0.15,并在1.5至2.5天内据称超过它,而同类人工开发被估计需要3至5名工程师投入6至12个月;模型FLOPs利用率从40.1% 升到44.1%(MiniCPM4-0.5B)、从47.0% 升到50.9%(8B模型)。 

    ModelBest的Forge Engineering双层回路:内环锻造单个场景,外环跨场景蒸馏经验并更新知识库

  • 腾讯混元Hyra:以「经验银行」保留可执行的过往经验(代码、执行日志、评分与评估器反馈),由上下文智能体组织灵感、多个提案智能体在隔离沙箱中并行求解,并把结果写回。它还把评估器本身纳入修订范围。报告的对比里,nanochat AutoResearch的验证BPB从0.9109降到0.9015,nanoGPT Speedrun的达标时间从77.5秒降到76.4秒,SOL-ExecBench的平均SOL从0.754升到0.771。 

    腾讯混元Hyra的经验驱动回路:上下文智能体组织过往经验,多个提案智能体在隔离环境中并行求解并接受评估,代码、执行日志与评估反馈写入「经验银行」

  • Agent-Native Research Lab:解决的是继承的载体问题,提出用可执行的「智能体原生研究工件」替代只面向人类阅读的论文式记录,保留形式逻辑、代码与规格、探索图(包括被放弃的分支)与原始实证证据;报告问答准确率93.7% 对72.4%,RE-Bench复现成功率从57.4% 升到64.4%。它同时把「确定性验证」当作瓶颈来对待,只有通过机器可验证闸门的结论才进入共享研究状态。

Agent-Native Research Lab的智能体原生回路,把引导式探索、确定性验证、知识继承与下一代学习连成可验证的工程发现流程

结论

那递归自我改进(RSI)到底走到哪一步了?如果用一句话回答:

工业界已经把‘局部策略搜索(L2)’用熟了,‘经验自主获取(L3)与环境适应(L4)’正处于攻坚期,而真正的‘递归元改进(L5)’在全行业依然处在实验室玩具和原型探索阶段。

 能做到的:AI 在给定的任务框架下,自己改改提示词、自动跑跑训练配置、把碰壁经验记进工具库和外挂记忆,甚至在代码环境里自己写测试修 Bug,这套流程各大厂已经跑通了。做不到的:让 AI 脱离人类预设的评价体系,自己决定下一次该学什么,甚至自己重构底层的自我改进机制、一代比一代进化得更快。当前的各种高分演进,本质上依然依靠人类工程师在外部不断搭梯子、拉红线和做最终把关。

读完这篇综述,RSI 对你而言就不再是一个被科幻狂想或营销话术层层包装的神秘概念,而是一把能一眼看穿当下各种“自我进化”营销噱头的清醒标尺。

未来已来,有缘一起同行!

文章标签应用落地学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多