Token导航 LogoToken导航

灵初智能发布Psi-R2.5具身模型聚焦数据转化

更新时间 2026-09-23来源 星河频率正文 5464字阅读约 18分钟8 张图片
图片

作者 | 安富建

过去两年,具身智能一个核心矛盾是:机器人需要大量真实世界数据,但机器人本身很难产生大量数据。

与此同时,人类每天都在真实世界里产生海量数据:从工厂装配、仓储分拣,到拿杯子、叠衣服,再到使用工具等。

所以灵初智能选择了一条看起来「反常规」的路线:先不使用机器人采集数据,而是让机器人学习人类。

今年 4 月,灵初智能用近 10 万小时人类操作数据训练 Psi-R2,并配合世界模型 Psi-W0 构建「数据-模型」闭环。

这证明了一件事:人类数据可以成为具身模型的预训练燃料。

那么,新的问题又来了:如果数据规模化是具身智能的关键,10 万小时之后,下一步是什么?

9 月 23 日,灵初智能宣布具身模型 Psi-R2.5 发布,对此作出回答。

10 万小时之后,灵初智能开始重新审视数据究竟应该如何被使用。

从 Psi-R2 到 2.5,这不仅是一次模型迭代,更大的意义在于:这让具身智能从「训练一个更强的模型」,进入到一个「让人类数据变成机器人数据的新阶段。

上一阶段,行业玩家看重的是「谁的预训练数据多」。

而在灵初智能看来,下一个阶段竞争的是谁能看懂哪些数据值得被规模化,并把它高效地转化为机器人可执行的数据。

人类数据的价值,不在于「收集」,而在于能否转化成机器人可以理解、执行和泛化的数据。

图片10 万小时」之后,灵初开始重新定义什么是好数据

10 万小时之后,灵初智能遇到的并非数据不够的问题,而是另一个更棘手的问题:10 万小时人类数据,究竟有多少真正能够帮助机器人学习?

对具身模型而言,数据规模化并不只是把小时数做大。

10 万小时数据,并不意味着 10 万小时的信息量。同一个任务重复采集 100 小时,可能不如 100 个任务各采 1 小时。满足任务与场景的多样性的高质量数据才是重点。

相比互联网公开视频数据、真机遥操作数据、仿真合成数据等,人类操作数据具有精细捕捉真实环境反应的优势,但也被认为并非机器人原生数据,难以直接用于训练机器人。

更困难的是,人类数据要用来训练机器人,需要解决两大鸿沟:

  • 一是视觉效果鸿沟,外观像素差异、相机拍摄参数、环境视角等视觉偏差;
  • 二是动力学鸿沟,人手与机器人关节的运动学不同。

在动力学方面,人手在捏住一个纸杯时,会自动根据接触面发生肉体形变,并维持稳定的力矩。而机器人机械手可能直接把纸杯捏爆,或者因为接触面积不足让杯子脱落。

真正高价值的人类数据,是能够被转换成机器人数据的人类数据。

通向 Scaling 终点的不是人类数据,而是能被机器人真正吸收的人类数据

要理解 Psi-R2.5,需要回看灵初智能在这条路线上走过的两步。

今年 4 月,灵初智能宣布具身数据量达到了 10 万小时人类数据,同时发布具身双模型架构:Psi-R2 和 Psi-W0

第一步,Psi-R2:证明「人类数据可以训练机器人」。

Psi-R2 是全球首个以 10 万小时量级人类数据预训练的 World Action Model,在 MolmoSpaces 评测中位列全球第一。

Psi-R2 回答的是:人类数据是否可以成为机器人基础模型的「预训练燃料」?

而能够证明人类数据可以训练模型,关键是人类手部做的动作机器人如何学习?

第二步,Psi-W0:解决「人类数据怎么变成机器人数据」。

Psi-W0 并不是传统意义上的仿真器,而是一个 Action-Conditioned World Model。

Psi-W0 以世界模型替代传统仿真器,绕开 Sim2Real 路线的限制,同时承担多重角色(评估、轨迹推演以及人类数据向机器人数据转换等)。

当 Psi-R2 在 Psi-W0 中执行一个动作后,Psi-W0 会给出反馈,判定动作成功与否。Psi-R2 在 Psi-W0 中持续做强化学习。

两个模型最大的区别是,Psi-W0 会输入大量失败数据,判定什么是对的、什么是错的,以理解物理世界的边界。

为了做好数据输入输出的对齐,人类手部操作数据输入 Psi-W0 之后,会「动力学迁移」到机器人形成一套新数据。

这意味着完成了「从人类数据到机器人数据的转化」。完成转化,才能利用。之后,新数据反哺给 Psi-R2,形成「数据-模型」闭环。

以上两步,灵初智能验证了人类数据训练具身智能模型的可行性,完成了从人类数据质量到机器人数据质量的转化。

灵初智能具身模型(Psi-R2.5)手机装配演示

第三步,也就是今天发布的 Psi-R2.5,要回答的问题是:数据的转换过程,能不能规模化

相较于上一代,Psi-R2.5 有两大核心升级:

一是在语言层面上对数据标注的精度提出更高的要求,大幅压缩单任务重复样本;

二是规模化生成使用强 Pair data 对齐人类数据和机器人数据。

灵初智能在技术博客中将这两点概括为「Scaling Quality, Not Just Size「和「Scaling Pair Data for Data Alignment」,即规模扩张,质量优先,不只堆体量。

图片

  图片来自灵初智能项目演示与完整技术博客:Scaling Pair Data for Embodied Intelligence https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/

新模型对既有的全量数据集完成全方位复盘、清洗与优化,为弥合数据转换的鸿沟提供了新的解决方案。

Psi-R2.5 模型升级的逻辑可以概括为「不拼数据量,拼数据质量和转化效率」。

Psi-R2.5 模型推出之后,在手机装配、纸盒插接等高精细度长程任务的成功率进一步提升。非结构化场景下模型的操作鲁棒性与泛化能力,是这一轮升级的要点。

图片

同时,为了评估模型能力的高低,灵初智能为模型预训练全流程深度嵌入了一套仿真评测体系,其中包括自研搭建包含 50 项高难度复杂任务的真机多任务专属评测集。

把整个评估做好,这保障了机器人输出的动作在物理层面让机器人可执行、可落地。

10 万小时数据量之后,人类操作数据这条具身路线开始在泛化能力、长时序执行能力和操作性能上限上显现技术优势。

图片Psi-R2.5 真正解决的,是「人类怎么教机器人」

从表面看,Psi-R2.5 首先是一次模型架构升级。

Psi‑R2.5 采用双层架构(高层规划器+低层控制器),模拟人类「大脑‑小脑」协同工作机制:

  • 上层(高层规划大脑):上层模型的网络骨干为 QwenVL3.5-4B,主打长时序任务理解与智能拆解,可将复杂自然语言指令拆解为精细化子任务,同时向底层模型传递专属任务子文本(Subtext)与价值优先级信息(Value);
  • 下层(低层控制小脑):下层模型的网络骨干为 Wan2.2-IT2V-5B,精准对接环境观测信息与上层任务指令,输出机器人可直接落地、连续稳定的完整操作轨迹。

但如果只看到 Psi-R2.5 的「大脑-小脑」,其实抓错了重点。

灵初智能有一个颇为反常识的判断:对于具身预训练模型来说,模型架构是最不重要的,两三天就能换一个。真正影响性能的,是数据。

灵初这次真正想解决的,并不是再设计一个更复杂的模型,而是让模型吃进去的数据变得「更对机器人的胃口」。

本质上,这套架构背后是对数据运用能力的升级。双层级模型依托同一套预训练数据完成联合训练,优化了模型架构协同性与任务适配性。

这套预训练数据的核心是强 Pair data配对数据)

Pair data,即人类与机器人执行同一任务时产生的成对数据。按对齐颗粒度的程度,它有强弱之分:

  • 弱 Pair data 解决的是「人和机器人做的是同一件事」;
  • 强 Pair data 进一步实现「人和机器人在同一个时间、同一个场景里,对同一个动作建立了可以执行的对应关系」。

比如人手拿起一个杯子,弱 Pair data 只知道「人和机器人都在拿杯子」,仅按照相同任务的语义理解;

强 Pair data 则要求两段数据在视觉上基本一致、时序上逐帧对应,物理层面(关节角度、电机扭矩等)也实现对齐,最终这条人类轨迹经过转换后,可以直接在机器人上 replay(真机重放)。

也就是说,强 Pair data 的对应之下,两者之间只剩下人类与机器人本体的差异。

强 Pair data 效果展示

强 Pair data 真正解决的,不是配对本身,而是把人类经验变成机器人能够理解和执行的数据。

用强 Pair data 训练出来的数据转换器,可以直接将人类数据转换成机器人数据。

这是灵初智能 10 万小时人类数据用于训练机器人的核心步骤。

因而,强 Pair data 解决的是「人类怎么教机器人」

灵初智能上一代模型(Psi-R2 在 Psi-W0)中,已经可以产生强 Pair data。

但这条链路比较重,从一条人类数据到 Psi-W0、Rollot、RL、机器人轨迹再到强 Pair data,每一条都要重新算一遍。

到 Psi‑R2.5 这一代模型,则极大简化了数据生产的流程。

规模化生成高质量的强 Pair 数据,是行业里不少公司希望实现的目标。

起初,灵初智能训练了一个能够直接生产强 Pair data 的数据转换模型。但是,这仍然延续了传统逻辑:基于已有的人类数据生成机器人数据,差别在于减少 gap 的手段(强化学习、轨迹优化等)的变化。

灵初智能这次反过来想:既然机器人轨迹本身已经是真实可执行的数据,为什么不从机器人数据出发,反向生成对应的人类示范

于是,Psi-W0 被反向调用。它从真实机器人真机执行数据出发,生成与之逐帧匹配的人类操作数据。

由此,灵初智能获得了大量此前很难直接采集的强 Pair data。

以这些强 Pair 数据为养料,直接训练出一个新的「端到端人类数据到机器人数据」转换模型。最终,借助这一转化模型,采用多种策略严格控制数据转化的质量,灵初智能实现了将人类数据与机器人数据的深度对齐。

从结果上来说,模型「逆向生长」的做法,让机器人开始有能力「给自己制造老师」——「自己教自己」。

图片

普通人甚至不必穿戴上数采设备,只要用手机或相机拍摄出随机的挥手、拿握等各种手部操作动作,灵初智能的模型能够理解并模仿人类动作,并高精度「复刻」输出这些动作。

如果说 Psi-R2 证明了人类数据可以训练机器人,那么 Psi-R2.5 就是如何让这条人类数据路径真正具备规模化能力。

图片真正到了客户现场,只做基础模型还不够

具身行业面对的一个现实是:短期内,机器人做不到 Zero-shot。

这不完全是机器人模型能力的限制,更是商业化现实的考量。靠预训练模型搞定所有的场景、任务,需要海量数据的投入。

以工厂为例,工厂里的零件 SKU 复杂,存在不同型号的材质、重量差异;流水线上的节拍快慢不同,要求机器人动作精确度;工作环境的改变对机器人传感器的影响;拧螺丝、插拔排线有工艺上的差别;此外,还有诸多无法提前预估的边缘案例。

因此,基础模型的意义不是零样本解决所有问题,而是把后训练的成本降下来

灵初智能开发了一套基于灵巧手的后训练「HIL + RL 框架」。这套结合了人工示范+机器人自主探索的后训练系统,能够在短时间内仅用极少的数据微调,完成复杂任务。

「手机盒装配任务」要求多步骤、精细操作,机器人从头至尾用模仿学习训练策略的成功率非常低。

灵初智能「HIL + RL 框架」只需要花费 1-2 个工作日,就帮助机器人能够将任务成功率提高到 99%。

当灵初智能 Psi‑R2.5 模型经过 10 万小时人类数据完成预训练之后,具身数据飞轮转起来,每部署一个新场景,积累的数据越来越多,而后训练消耗的数据则越来越少。

相比几个月前,具身模型后训练需要消耗的真机演示数量,如今「HIL + RL 框架」下训练模型仅需少量示教数据。

目前,「HIL + RL 框架」已成功落地真实工业客户现场,解决各类复杂场景与任务的作业难题。

用少量数据完成任务适配,高效轻量化的后训练,打通「数据采集-模型训练 -真机落地-现场数据回流」的循环,才能持续迭代。

今年,灵初智能目标构建「百万小时级别」的高质量可用数据集。

这并非单纯追求数据总时长,而是通过自建采集站点,以及和业务方合作的方式完成数据回流。「HIL + RL 框架」在部署时,实时收集失败案例,回流数据到公司,以提升基础模型能力。

不过,后训练的加入,仍然是「人类教机器人」的阶段。

更远的一步,是让机器人不再需要重新训练。

眼下,热门的上下文学习(In-Context Learning)思路,在不重新训练模型的前提下,让人示范一遍,以类似「提示词」的形式加入到模型,能够提升泛化能力。

灵初智能自研强 Pair Data 数据转换管线,能够高效将人类数据转化为机器人数据,更好地作为「提示词」输入到模型,最终做到基于上下文对新任务实现「零样本泛化」。

自此,灵初的技术路线形成三个阶段:

  • 预训练,解决机器人怎么获得基础能力;
  • 后训练,解决机器人怎么快速学会一项工作;
  • 上下文学习,解决机器人怎么做现场学会新工作。

贯穿三个阶段的底层能力,是从人类数据到机器人数据的转换,是强 Pair Data。

围绕强 Pair Data(强配对数据),以 Psi‑R2.5 模型推出为节点,灵初智能搭建起从数据生产、人机对齐、模型训练、评测验证到产业落地的完整链路。

回过头看,Psi-R2 证明人类数据可以成为机器人的预训练数据,Psi-W0 解决人类数据如何转成机器人可执行数据,Psi-R2.5 进一步解决了这一转换如何规模化。

灵初智能这次真正规模化的,不只是模型,还有从人类数据到机器人数据这条生产链路。

这也让 Psi-R2.5 的发布,从一次模型的升级,变成一个更有行业意义的判断:

具身智能的数据瓶颈,可能不是机器人产生不了足够多的数据,而是机器人还没有找到足够高效的方法,把人类已经产生的大量真实世界经验变成自己的数据。

10 万小时之后,灵初开始回答的,正是这个问题。

图片
文章标签模型发布机器人应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多