Token导航 LogoToken导航

RSI热潮延伸至具身智能的理想与现实

更新时间 2026-09-29来源 星河频率正文 6338字阅读约 20分钟11 张图片
图片
作者|毛心如
9 月初,OpenAI 发布 GPT-6 Astra。
第二天,独立评测机构 Robocurve 把它接上一台双臂机器人,任务很简单:抓起积木,放进碗里。
20 次尝试里成功了 19 次,token 消耗只有对比模型 Fable 5.1 的约六分之一。
紧接着,具身智能圈的讨论瞬间被引爆。通用大模型将接管机器人、具身智能会沦为基座模型的一个子领域,类似的论调一时四起。
而冷水来得也快。RoboDojo 团队随后在官方真机评测中给出结论:Astra 反复发出物理上不合理或不安全的动作,部分事故甚至造成硬件损坏,原定 18 项任务的评测被迫提前终止。
三周后,RoboDojo 榜单先后易主。登顶的分别是一家成立仅三个月的公司 Simate,以及「MMLab HKU & 超维动力KAI」。
两次登顶,靠的都是 Physical RSI。
RSI(Recursive Self-Improvement,递归自我改进),这个词的热度正在迅速从大模型领域蔓延到机器人行业。
Anthropic 在 6 月的报告里披露,自家代码库超过 80%的合入代码由 Claude 编写,并把 RSI 称为自进化的终极形态。
8 月,王兴兴在世界机器人大会上公开了物理 AI 自进化体系;9 月,前小米 XLA 大模型负责人陈龙赴硅谷创业,方向同样是自进化的具身大脑。
一时间大模型公司、机器人公司、顶级人才,仿佛都在谈 RSI。
但这究竟是一场概念包装的热词营销,还是具身智能范式转移的前哨战?
图片具身 RSI 祛魅:
它是目标,不是技术
RSI 并不是一个新概念。
它的雏形可以追溯到 AlphaZero 的自我博弈,不靠人类棋谱,AI 左右互搏就能超过人类顶尖棋手。
2025 年 DeepMind 把逻辑讲透了:人类数据快被用完了,接下来 AI 要从自己的经验里学。
此后 Karpathy(OpenAI 创始成员之一)的 AutoResearch 演示了 AI 做研究反哺 AI 的最小闭环,DeepMind 的 Dream-RSI 论文、智谱的最小闭环验证陆续跟上。
这些工作跨越了游戏、大模型、基础设施优化,但共享同一个方向:让系统从自身经验中学习,而不是依赖人类投喂。
但越是热门的概念,越容易被滥用。
从本质上看,RSI 是一种目标,不是一种技术。强化学习、自监督微调、持续学习,是具体的技术路径,奖励是什么、标准答案是什么、梯度怎么更新,这些都可以被精确定义。
而 RSI 说的是让系统能够利用自己的经验持续变强这件事本身,至于用什么架构去实现,是开放的。
一个业内通行的检验方法是,把 Recursive、Self、Improvement 三个词逐一对照。
Improvement 最容易做到,有数据回流、有训练、有性能提升,就能实现改进。
其次是 Self,数据采集、任务筛选、参数调整等环节如果仍然高度依赖人,系统只是有人参与的自动优化。
最难的是 Recursive,因为不仅能力要变强,负责让自己变强的机制也要能被改进。
大模型领域之所以被认为已经触及了 RSI,是因为 AI 研发正在反过来加速 AI 研发。Claude 参与写 Claude 的代码,AutoResearch 优化 AutoResearch 的流程,这是一个真正的递归闭环。
而按照这个最严的标准推下去,具身的终极 RSI 应该是机器人系统自己改进机器人系统:觉得硬件不行就改进硬件,甚至自己组装一台新机器人。
这一步目前还没有人走到。
与此同时,学界也试图为 RSI 画一把尺子。
上海交大、清华、字节跳动、上海 AI 实验室等机构近期联合发布的综述《The Last AI Built by Humans》,首次将 RSI 系统性地分为五级:
  • L1 执行自主,人类设计任务和策略,智能体执行并更新
  • L2 策略自主,智能体自主设计更新策略
  • L3 经验获取自主,智能体自主规划经验获取
  • L4 环境适应自主,人类设定边界,智能体自主适配环境
  • L5 递归继承自主,智能体改进改进系统本身
图片
这套框架虽然是面向通用 AI 提出的,但用来观察具身 RSI 同样有参考意义。 
把现有的具身智能 RSI 项目放进这把标尺里,大家都还停留在人机共驾的弱 RSI 区间,即 L2 到 L3 之间。
AI 能自己选策略、能主动拉数据做验证,但为什么这个策略更优、该重写哪段逻辑才算真正升级,还得人来拍板。
在 L2 到 L3 之间,不同团队选择了完全不同的路径。
有的在执行层做 RSI,让 Agent 把推理固化成代码,逐步沉淀出可复用的技能树;有的在策略层做 RSI,让机器人在真实执行中在线强化学习,只对实际执行的动作做梯度更新;还有的把 RSI 推到研发层,让 AI Agent 承担模型研发、数据处理、实验评测的更多环节。
它们共享同一个目标,但回答 RSI 到底怎么做的方式截然不同。
图片三条工程路线,
三种不一样的「自我进化」
具身 RSI 目前仍处于混沌期,行业并没有形成统一的标准范式。
我们选取了三种不同的切入角度,从任务执行层 RSI、策略参数层 RSI 和算法研发层 RSI 来理解不同路线、不同层级怎么抵达同一个目标。
这里说的层级不同,不是工作深度或研发阶段的先后,而是各自把自我进化的作用对象放在了不同位置。
如果把机器人能力简单拆成理解任务、规划任务、生成技能、生成动作、执行动作这五层,那么目前这三个具身 RSI 案例分别卡在不同环上,改的对象并不一样。
星尘智能的 SmoothRL,是目前这条链路里最靠近机器人执行端的一种尝试。
它回答了一个具体的工程问题:机器人刚刚执行完的动作效果不达预期,能不能直接利用这一次真实世界执行得到的反馈,立刻更新 Policy(策略网络),而不是回到实验室离线重训?
SmoothRL 的核心,是把 Online RL(在线强化学习)嵌入异步推理的真实机器人执行流程当中。
在真实真机部署场景,机器人会输出 Action Chunk(动作块)给到机械本体执行,就在机器人执行这一组动作的同时,大模型已经在后台并行计算下一轮的动作序列。
这就会出现一个矛盾:上一轮输出的动作块中,部分动作还没来得及被硬件执行,就被后续新推理出来的结果覆盖掉了。
传统在线 RL 会把整段动作块全部计入损失计算,把大量没有真正落地的动作拿来训练,造成对错账,污染学习信号 
SmoothRL 的关键创新,就是区分动作块内哪些动作真正被物理本体执行、哪些已经被后续推理覆盖,只把真实落地执行过的动作样本参与 Policy 更新。
它没有等机器人做完完整任务,再把数据回传实验室离线重训,而是打通执行、拿到真实物理反馈、更新策略、再次执行的快速闭环。
在星尘智能团队看来,RL 本身就可以构成递归循环,而且 Online RL 的特点恰恰是这个循环可以跑得更快:模型根据真实世界刚刚产生的反馈,直接进入下一轮策略更新。
这和传统离线训练最大的区别,是真实反馈到策略更新之间的链路被大幅缩短了。
如果长期坚持这条路线,真实世界中产生的数据最终还可以回流到基座模型,形成更长期的能力积累。
也就是说,一次任务上的 Policy 更新,并不一定只服务于这一次任务,它还可能成为下一轮基座模型迭代的数据和经验来源。
而经验复利也由此发生,每次在线更新后,模型实时知道自己有了更强的版本,下一轮学习站在新的起点上。
Physical Intelligence 的 π0.7 也遵循相似的迭代逻辑,会在 π0.6 和历史强化学习数据的基础之上持续迭代演进。
SmoothRL 真正改变的是机器人 Policy 如何从真实世界获得下一次更新。
图片
穹彻智能的 RoboRSI,则主要落脚在任务方法与技能沉淀这一环。
它面对的问题是:机器人接到一项陌生任务做不好的时候,能不能自己摸索、迭代出一套更好的任务完成方法,沉淀成可复用技能,而不是每一次都要人类工程师手写控制代码。
RoboRSI 没有把所有工作都交给一个大一统大模型,而是拆解出 Manager、Planner、Engineer、Reviewer 多个分工明确的 Agent 角色,把任务接收、规划拆解、代码编写执行、复盘修改分别隔离到不同上下文当中,让不同 Agent 各自处理相对明确的工作,也避免单个 Agent 的上下文无限膨胀。
这种拆分的意义,不只是把更多流程自动化,也是在重新划分人和 Agent 各自需要处理的复杂度:Agent 负责大量具体的任务拆解、代码执行和失败复盘,人类则不必直接介入每一个执行细节,而是通过 Agent 整理后的结果,获得更容易理解和判断的决策材料。
这个项目最重要的 Knowhow 集中在 TSR,也就是 Top-down Skill Refinement(自顶向下技能细化)机制,它解决的则是 Agent 自我迭代过程中应该从哪里改、哪些东西应该保留的问题。
同时,项目还配套了一套技能信任机制管理整套技能树。
经过真机验证、运行稳定的 Skill,会被标记为可信能力,避免 Agent 在下一轮迭代中反复修改已经验证有效的模块。
穹彻团队在项目早期,曾经尝试过自底向上(Bottom-up)的构建思路:让 Agent 先一个个编写底层 Skill,再把零散 Skill 拼接成为完整任务。
但他们很快发现,Agent 很容易陷进局部问题里,通俗理解就是钻牛角尖。
一个模块出了问题,它就不断修改这个模块;修改以后又影响其他模块,再继续修改。最后虽然局部代码越来越复杂,却不一定离最终任务更近。
于是他们转向自顶向下的建设思路,先确定完整任务的整体拓扑结构,定义清楚各个模块之间输入输出接口与依赖关系,最后再向内填充具体 Skill 实现。
经过真机验证、运行稳定的 Skill,会通过 Trust 信任机制被标记保护,避免 Agent 下一轮迭代又去改动已经被验证有效的代码模块。
这里有一个重要的认知转变:自我改进的难点,并不是让 AI 无限制地反复修改,而是让 AI 知道什么应该改、什么不应该随意改动。
这也是 RoboRSI 和普通 Agent 最大的区别之一。
Agent 负责任务方案尝试,Reviewer 承担最高权重推理负责失败复盘,Skill 负责沉淀成熟能力,Context 管控全部历史经验。
整套机制最终目的,是把这一次碰巧执行成功,转化为未来遇到同类任务,可以直接调用的成熟能力。
图片
Simate 选择把研究视角落在更上游的算法研发维度。
它的 AutoResearch,不再局限于机器人执行阶段的动作调整或者任务技能生成,而是把 Agent 直接嵌入机器人算法研发全流程,尝试用 AI 承担大量原本由算法研究员完成的重复性科研工作。
这里也做一个区分:RoboRSI 的 Agent 是机器人任务工程师,产出机器人干活的控制代码;而 AutoResearch 里的 Agent 更像算法研究员助手,产出的是模型、实验配置与算法方案。
在 AutoResearch 的闭环当中,人类研究员牢牢把控研究方向、目标与约束边界,Agent 承担大量实验执行工作。
最终形成完整循环:提出研究假设、规划分布式实验、修改模型或配置、调度执行实验、调用 RoboDojo 完成评测、分析实验结果、迭代生成下一轮假设。
为了让 Agent 可以真正修改、组合机器人模型组件,Simate 公开了 SiPAI 可插拔模型框架,试图让 VLA、WAM、World Model 等不同模型组件,能够被 Agent 理解、拆解、替换和组合。
图片
进而让研究想法可以直接落地为可运行的模型实验,而不需要每次从零重建整套工程代码体系。
不过这套体系同样属于人机共驾的弱 RSI 范畴。AutoResearch 的进化对象是机器人的算法与模型方案,并不是直接让物理机器人本体在真实环境中自我迭代。
它高度依赖仿真评测基础设施,在仿真环境下可以高并发跑大量实验,一旦落到真机,环境 Reset、不可恢复物理故障依旧是难以绕开的阻碍。
所以,在今天的具身 RSI 讨论框架下,并没有所谓的技术收敛。
有人在研究怎么让机器人动作自己变好,有人在研究怎么让机器人完成任务的方法自己变好,还有人在研究怎么让研究机器人本身的流程自动化。
它们最后指向的其实是同一个问题:能不能让机器人的下一次能力,不再完全依赖人类工程师亲手做出来。
图片物理世界不发「重开」键
三条路线走到最后,都会碰到同一个问题:一旦进入物理世界,很多在数字世界里理所当然的事情,都没那么容易了。
软件里的实验失败,可以回滚代码、重跑模型;仿真里的机器人做错了,Reset 一下就能重新开始。
真机没有这么方便。
机器人把垃圾桶撞倒了,环境就变了;把杯子打翻了,下一次实验面对的已经不是原来的场景。
穹彻智能团队甚至提到,在真实机器人环境里,Reset 有时比完成任务本身还难。
这也是具身 RSI 和软件 Agent 最大的区别之一:机器人每试错一次,都可能真的改变这个世界。
所以,真正难的并不是让 Agent 多尝试几轮,而是让它知道哪一次尝试值得保留,哪一次失败应该修正,以及修正之后到底有没有变好。
RoboRSI 里的 Reviewer,以及对已经验证 Skill 设置的 Trust 机制,本质上都在解决这个问题:不是让系统无限修改,而是让它知道什么该改、什么不要动。
图片
RoboDojo 这类统一仿真-真机评测,也是在补上同一块拼图。
官方目前设置了 42 项仿真任务和 18 项真机任务,并对硬件、场景 Reset、评测协议等进行统一,让机器人能力能够在相对一致的条件下反复验证。
对 RSI 来说,这一点尤其关键。没有可靠的评价机制,就很难有可靠的 Improvement。
如果系统连我这次到底有没有变好都判断不了,所谓自我改进就很容易变成不断试错。 
因此,具身 RSI 真正需要建立的,不只是一个会自己改代码的 Agent,而是一条完整的链路:执行、反馈、评价、记忆、更新、再执行。
而这条链路越往后走,人类的位置才会真正发生变化。
今天,人还需要决定目标、设计实验、判断结果;下一阶段,可能只需要设定目标和边界;再往后,系统甚至需要自己决定下一轮到底应该改什么。
这才碰到了 RSI 最核心的那个词——Recursive。
面对现在越来越多的 RSI 概念,判断一套系统到底走到了哪一步,其实可以看三个问题:
  • 改进后的能力能不能留下来,换一个任务还能不能用
  • 迭代能力本身有没有被改进,而不只是任务成功率提高
  • 人类究竟还参与多少,是在手写代码、调参数,还是已经退到设定目标和安全边界
这三个问题,也许比是不是 RSI 这个标签本身更重要。
图片
穹彻智能RoboRSI在仿真环境中的系统性定量验证
沿着这条路继续往前推,机器人未来需要回答的不再只是这个任务怎么做,而是为什么没做好,下一次应该改哪里,如果这个方法一直不奏效,是不是应该换一种学习方法。
从 SmoothRL 对 Policy 的在线更新,到 RoboRSI 对 Skill 和 Agent 工作流的重构,再到 Simate 尝试把 AI 带进机器人研发流程,三个案例其实正在从不同方向逼近同一个问题:
能不能让机器人的一次经历,成为下一次进步的起点?
现在显然还不能说已经实现。
真实世界的 Reset、评价、硬件差异、数据成本,以及人类在目标设定和关键判断中的作用,都还没有被彻底解决。
具身 RSI 仍处在很早期的阶段,更多真机验证也仍然是绕不开的一关。
但变化已经发生了。
过去,机器人研发的基本单位是一轮训练、一次部署、一个新技能。
现在,越来越多团队开始追问:一轮自我改进之后,机器人能不能站在新的起点上继续改进自己?
如果有一天,机器人不只是被人训练,而是开始参与决定自己下一轮应该学什么、怎么学,以及如何验证学得对不对,那么具身智能才真正开始触碰 RSI 这个词背后的含义。
而这件事也不止是技术层面的跃迁。
如果机器人能够把越来越多的训练、调试和部署工作变成自己的成长过程,人类工程师需要投入的时间和成本就有可能随之下降。
对于需要频繁换场景、换任务的机器人来说,这意味着过去一次次依赖人工重新开发、重新调试的模式,可能被一种持续自我迭代的方式替代。
自进化真正打开的,不只是机器人能力的上限,也可能是机器人规模化落地的另一种商业可能。
这或许才是机器人真正意义上的「成长」。
图片
文章标签机器人智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多