Token导航 LogoToken导航

9月机器人公司集体转向机器人“大脑”研发

更新时间 2026-09-29来源 虎嗅网正文 3487字阅读约 11分钟

Figure、亮源新创、宇树科技、智元、松延动力集体转向模型与数据,机器人训练数据来源从真机转向人类行为视频

本文来自微信公众号: 科技C位 ,作者:东木褚

9月17日,旧金山湾区,一台Figure 03人形机器人被送进一栋从未踏足的住宅。

没有提前采集数据,没有现场微调,它开始铺床、叠毛巾、收拾散落一地的玩具。

同样的测试在30套陌生住宅里进行,420次尝试,237次完整成功。

四天后,亮源新创发布了一条一镜到底的视频:

两台形态不同的机器人在同一个模型驱动下开门迎客、递物、收纳,其中一台擦桌子时意外碰倒了地上的瓶子,另一台重新识别位置,走过去把瓶子捡了起来。

再把日历往前翻:

9月8日,松延动力发布世界模型HERON-World Model;

9月9日,智元机器人一天连发AGILE 2.0和GE-Act 2.0两款模型;

9月10日,宇树科技开源基础模型UnifoLM-WLA-1.0;

9月15日,松延动力又补上一款HERON-CRA。

国内三家本体厂商8天发了5个模型,国外估值390亿美元的Figure和中国初创公司前后脚亮出新一代"大脑"。

过去两年,这个行业的发布会主题是电机、关节和翻跟头。

这个9月,没有一家把硬件摆在海报上,战争换了一个战场。

五份答卷,五种打法

Figure的答案写在数据里。

Helix 2.5在30个陌生家庭拿到56%的完整任务成功率,铺床67%、叠毛巾62%、整理客厅40%。

单看不够惊艳,真正的信息藏在对照组:同样硬件、同样任务数据,拿掉预训练,成功率只有9%。

从9%到56%,中间隔着Figure自建的Index数据平台。

它付费招募全球普通人拍摄日常操作,8月25日上线至今,视频超过1600万条,新数据以每秒约35分钟的速度涌入,公司已向创作者支付1500万美元,并承诺为训练投入35亿美元算力。

每1000小时数据覆盖373项任务、1146种物体、116种环境。

Figure还报告了一条此前只属于大语言模型的规律:预训练数据每次翻倍,机器人动作预测误差平滑下降,小数据实验能把最大规模训练的损失预测到小数点后四位。

亮源新创的答案写在成本结构里。

这家创始人出自OpenAI的公司没有去采集数据,而是盯上了互联网现成的人类行为视频,规模超过10亿小时。

难题在于,视频记录了"别人怎么动",机器人要学的是"自己的身体怎么动"。

Light-O1的做法是从视频中恢复结构化的人类动作,映射到统一的人形动作空间,让动作知识既不绑定某个人的身体,也不绑定某台机器人的机械结构。

预训练数据从37.5亿token扩到1200亿token后,跨本体、跨视角的动作预测误差呈幂律下降,团队称之为迁移缩放定律。演示任务对应的真机后训练数据,只有几十到一百条。模型权重和代码已经开源。

宇树的答案写在开源里。

UnifoLM-WLA-1.0以60亿参数、约2500小时真机数据训练,一个模型统筹64项任务,54项桌面操作加10项全身操作,还能适配二指夹爪和多种五指灵巧手。

配套的具身推理模型在16项多模态基准中拿下7项开源第一,空间理解单项超过头部闭源模型。它的世界建模做法很务实:不逐帧脑补整段未来视频,先用光流圈出真正会变化的那一小块区域,只预测"哪儿会变"。

这家刚上市、市值从高点4400多亿回落到2100亿上下的公司,在招股书里写明要拿20多亿元投向智能模型研发。

智元的答案写在数据规模实验里。

GE-Act 2.0用300小时、1200小时、5000小时、3万小时四档数据训练同一模型,数据扩大100倍,取得非零成功率的任务从39项增加到76项,折叠毛巾、嵌套纸杯这类精细操作在3万小时规模时才出现能力跃升,且没有饱和迹象。

同一天发布的AGILE 2.0走另一条路,把视觉感知和全身运动控制耦合进一个闭环,演示视频里灵犀X2踩着大球行进、钻火圈、跳长绳,这是行业第一次有双足机器人自主完成踩球。

松延动力的答案写在记忆和纠错里。

HERON-CRA给机器人装了三样东西:超过1分钟的时空记忆、即插即用的强化学习引擎、跨本体预训练。

叠袜子任务上,纯模仿学习的成功率是38.5%,打开强化学习引擎后变成97.8%。演示里它能记住20多次调换后球在哪个杯子,也能在中途被黑布遮住部分视觉信号后继续操作。

真正的突破:数据换了来源

五份答卷放在一起,一个共同的转向浮出来:机器人训练数据的来源,正在从机器人自己身上挪开。

此前的范式是真机遥操作,一名操作员、一台机器人、一个时间点,产出一份数据,昂贵且慢。Figure的判断是"需要的数据不存在于互联网",于是自建昂贵但可控的采集网络;

亮源新创反着来,赌互联网上海量免费视频里的嘈杂经验可以被提纯;Dyna在8月做过一组更细的实验,1000小时、1万小时、10万小时、100万小时四档人类视频预训练,经同一套机器人后训练,14项真机任务的平均得分依次爬到任务上限的20%、28%、45%、53%。

三条路径,揭示了一个共识:

人类在物理世界里积累的行为经验,正在取代机器人真机数据,成为预训练的主角。

大语言模型靠互联网文本获得了对语言世界的理解,现在轮到机器人从互联网级别的人类行为中汲取对物理世界的经验。机器人行业找了很多年的"自己的互联网",这个月有了雏形。

这里值得点破一层:这轮模型发布潮的表面是技术突破,里子是一场数据战争的开局。

Figure花1500万美元买的就是数据资产,亮源赌的是数据可以近乎免费,宇树把模型开源则是要让开发者的场景和数据回流到自己的生态里。

三家公司对同一个问题,也就是谁掌握下一代训练数据,给出了三种出价方式。

进入大模型决战时刻

本体厂商集体转向,首先是时机到了。

松延动力董事长姜哲源的判断很有代表性:

2023年创业时行业最大的短板是本体和运控,如今本体在成本、可靠性、性能上已经拿到及格分,而2023到2024年还分散混乱的模型技术路线,今年在世界模型与VLA融合的方向上形成了共识,正是切入的窗口。

其次是资本在用脚投票。

2026年上半年国内具身智能赛道融资约438亿元,其中以具身大脑为核心业务的公司拿走222.53亿元,占比过半;本体整机公司同期只拿到56亿元。

2026年至今拿到融资的具身模型公司超过140家,是去年同期的1.5倍,融资总额超1000亿元,是去年同期的三倍多。

香港中文大学高等金融研究院客座教授郑磊直言:

“本体厂商除非绑定场景拿下真实订单,否则越来越难获得独立融资。”

换句话说,"补大脑"一半是被技术路线图推着的,另一半是被融资结构逼着的。宇树开源的时机就很说明问题。

市场该按硬件厂还是按平台给它估值,两套算法差出好几倍,开源是它能给"平台叙事"投出的最重一票。

王兴兴在今年世界机器人大会上说得更坦白:公司目前最大的投入方向就是AI模型,谁能把机器人用的大模型做出来,谁就是全世界最厉害的AI公司和机器人公司。

赛迪研究院在《具身智能技术与产业发展报告》里给这个转向下了个注脚:

全球具身智能竞争已从比拼单机演示效果,转向模型、数据、本体、仿真、评测、交付的全链条体系能力比拼。

会翻跟头的时代结束了,客户开始拿着计算器算投资回报率。

183次失败

热闹的另一面,这个9月也出现了行业里少见的景象:同行不再客气。

Figure公布成绩后,Sunday Robotics联合创始人Tony Zhao立刻指出,237次成功同时意味着183次失败。

家庭里有易碎品、儿童和宠物,"偶尔能做完"和"放心让它独立干活"是两回事。

Synapticon前CEO Nikolai Ensslen的说法更尖锐:44%的任务没有完成,这恰恰证明模仿学习路线不能真正泛化。

伯恩斯坦9月24日的专题报告给了这轮热潮最冷静的定性:Helix 2.5跨越的只是"场景",还不是"任务"。

机器人依然要为铺床、叠毛巾分别接受专门训练,真正的零样本任务泛化还远;56%的成功率远不足以商用,预训练通常能把成功率带到50%至60%,从这一水平到99%的路径,是下一场大考。

报告的结论落在节奏上:大脑模型正以每季度可感知的速度进步,但大规模部署不会很快到来。

王兴兴自己给行业立过一把尺子:机器人被部署到陌生环境,通过语音指令能完成80%的任务,具身智能的ChatGPT时刻才算到来,快则两三年,慢则五到十年。

极佳视界首席科学家朱政则提醒,语言模型在数字世界输出文本,容易制造惊喜瞬间;具身模型要在物理世界里一点点磨,可能根本不存在那样一个瞬间。

9月的发布潮会过去,真正留下的是Figure数据平台上每秒新增的35分钟人类经验,和伯恩斯坦报告里那道没有答案的算术题:

从56%到99%,到底还要灌进去多少数据、多少钱。

五家公司把模型亮出来了,接下来比的是谁先填满这道算术题的括号。

文章标签机器人大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多