
©有界UnKnown原创
作者丨山茶
编辑|韩林
机器人距离走进家庭还有多远?
从技术层面要回答这个问题,就是机器人的长尾泛化能力和稳定性做得怎么样了;翻译成人民群众能听懂的语言,就是机器人在从未见过的环境中,还能不能继续完成任务。
9月17日,美国明星人形机器人公司Figure发布了新一代机器人模型Helix 2.5。同时发布的,还有一条长达的3小时57分钟的视频,展示Figure 03基于Helix 2.5,在旧金山湾区30个真实的,此前从未见过的家庭中进行测试的情况。
结果上,搭载Helix2.5后,Figure 03在这些从未见过的场景中,无需现场采集数据或微调,即可直接执行整理房间、折毛巾和铺床三类长程家务;在严格要求完整完成任务的评测中,Index预训练模型的zero-shot成功率达到 56%,相比从零训练模型的9%提升超过6倍。
Figure官方表示,这是首次在人形机器人上实现如此大规模的零样本全身泛化能力。同时,Helix 2.5首次证明,全身智能可以从人类经验中学习并迁移到新的场景,而无需每次都重新构建。
所以回到最初的问题,从这个结果来看,Figure已经让人形机器人初步具备了进入家庭服务的条件。
那么,我现在来具体看看,在Helix 2.5的加持下,Figure03能把家务做到什么程度?给机器人行业又有什么启示呢?

机器人摆脱“一地一训”?
这次测试,Figure选择了整理房间、铺床和叠毛巾三项全身性任务。
所谓全身性任务,是指需要调动感知、运动、操作、双手协调和全身控制能力。目前行业里关于机器人泛化能力的演示,大多都是围绕一个固定场景来完成的。
比如在厨台上分拣水果,或者在桌面上整理衣服,机器人基本都是固定不动,或者移动范围非常小。
而Figure这次,除了叠毛巾是一个相对固定的场景之外,剩下的整理房间、铺床都需要机器人在房间里辗转移动,弯腰、识别物品、双手协同。
比如铺床任务中,工作人员把整齐的床铺弄乱,被子掀开,枕头扔到一边。
由于床的面积较大,机器人无法站在一个位置完成全部铺床动作。它会先整理靠近自己一侧的枕头,再绕到床的另一边,整理另一个枕头。铺平床单也是同样的逻辑:先处理一侧,再移动到另一侧继续完成。整个过程和我们日常在家铺床几乎一模一样。
这一点在整理房间的任务中表现更明显。
工作人员将一堆小玩具扔在客厅的各个角落,机器人会捡起旁边的收纳袋,再一个一个寻找散落的玩具,将它们捡起并放回袋中。
这个过程,玩具可能会掉在茶几上,掉在沙发上,或者沙发靠背的缝隙里,机器人需要不断移动,识别,弯腰,双手协作,就像人在家收拾客厅一样。
相比而言,叠毛巾反而是一个比较常规的展示了。
但这里面也有一个有趣的点,就是和大多数机器人只会机械的叠毛巾不同,Figure这次展示的内容中,工作人员把毛巾和装毛巾的盒子仍在台面上,机器人的工作位置是被篮子挡住的。
所以这个时候,机器人的第一步不是叠毛巾,而是先把篮子移开,为自己创造工作环境,然后再开始叠毛巾。
今年上半年,Figure发布Helix 02后,已经可以让机器人协调视觉、触觉、手掌摄像头以及全身关节,来完成如洗碗、铺床、整理卧室这些功能。
但当时Helix 02存在一个根本问题,就是每到一个新环境,就需要重新采集数据。而在大概半年之后的今天,Helix 2.5初次接触这些环境时就能独立完成的任务(成功率56%)。
也就是说,现在把这个机器人搬到你家里,它也有同样的概率自己完成这些工作。
除此之外,Helix 2.5还展现出了比较明显的自我纠偏能力,即通过不断调整,比如改变位置,改变站姿来使自己更好的完成任务,这是机器人能够在未来应对复杂的环境所需要的基础能力。
所以我们说,Figure补上了人形机器人进入家庭的一项关键技术前提。

数据、数据、还是数据
那么,Helix2.5是如何实现这些能力的呢?
这里面的一个关键,是引入了Index。
这是Figure在今年8月正式公布的一个专门为Helix 提供预训练数据的基础设施,一套超大规模“人类物理行为数据集 + 数据采集系统”。
Figure认为,机器人数据太贵,采集过程也很浪费时间。相对而言,人类每天都在洗衣做饭,整理房间,如果能够把这些行为变成训练数据,就可以绕过“每台机器人都要亲自去采数据”的限制。
因此,Figure建立了一个类似众包平台的系统,让全球用户上传第一视角/行为视频,再经过过滤、去重、分类和标注,进入 Index。
8月公布Index时,Figure就称其已有超过26.4万次App下载、覆盖100多个国家、累计超过1600万段视频。到这次模型发布,Figure宣称Index每秒大约能新增/采集约35分钟人类经验数据,相当于一天就能拥有302万分钟的视频。
除此之外,使用人类数据还有一个好处,比如前面提到的自我纠偏能力,Figure认为,就是引入人类数据的原因。
这样的方式也成为现在机器人行业普遍采用的路径。
国内之前就有报道,某机器人公司为了采集数据,让一些工作人员进入居民区协调拍摄,但因为过程过于繁琐,导致居民难以忍受而报警。
这当然算是一个笑话。
但在国外,使用专门的头戴式设备采集日常工作影像,已经成为很多人增加收入的方式。
比如在印度,多工厂工人和理发师,都开始在工作时采用头戴式的摄像头来记录工作过程,
在国内,也有一些企业开发了类似的头戴式数据采集设备。普通劳动者可以在日常工作时佩戴该设备记录操作过程,通过上传相关数据,即可获得相应的报酬。
而这些视频,经过专门的清洗和标注之后,又会成为未来机器人下一次进步的“燃料”。

机器人自己的Scaling Law
当然,光有数据还不足以让机器人的能力获得如此快速的进步,所以就有了这次Figure观察到的另一个现象——Human-to-Humanoid Scaling Law。
我们知道大模型有Scaling Law,即只要投入更多的数据,更多的算力、做出更大的模型,AI就会变得更聪明,而且这种变聪明的幅度是可以提前用严谨的数学公式计算出来的。
但在机器人领域,在机器人领域,虽然目前也有不少证据表明,发现随着数据量的提升,机器人的能力也会随之提升的,但还没有一个统一的,可预测的Scaling Law。
这里的重点是,可预测性。
而这次Figure的工作,证明了在模型规模和下游任务训练保持不变的情况下,增加 Index 中的人类行为预训练数据,可以比较稳定、可预测地降低机器人下游动作预测的 loss。
即一个初步的人类经验向人形机器人迁移的 Scaling Law。
这次Figure一共训练了 4 个模型,这些模型使用的是Index数据集不同规模的子集,从最小数据量到最大数据量相差 8 倍。
实验中,Figure刻意控制包括模型大小、下游任务训练数据、Fine-tuning 方法、测试集这些变量,只看预训练阶段看到的人类行为数据的多少。

结果是,每当 Index 数据规模增加,机器人在下游任务中的 next robot action prediction loss 都持续下降,而且下降趋势相当平滑。
他们用前三个较小规模实验拟合出的规律,去预测还没有训练的最大规模模型,得出的结果是,预测误差只有整个8倍数据区间loss变化幅度的 0.54%。
即,他们在最大实验开始之前,就把最终test loss预测到小数点后四位。

更重要的一点是,Figure验证的这个 Scaling Law 用的是“人类数据”。就是人带着摄像头采集的,各种家庭、工业场景下的操作数据。它与机器人实机操作数据相比,数据量更大,更容易获取,成本更低。
这相当于为后续具身智能模型的训练,确定了一条可行的、稳定的、更低成本的路径。
当然,Figure这次的验证也存在一些不足,比如更多的Index数据集,家务成功率是否能够按照同样规律提高、更多种任务能力是否也能按照同样规律出现,这些都还需要进一步验证。
但这并不妨碍Figure在这方面积极的投入,
Figure表示,他们已投入35亿美元的计算资源用于训练Helix。这些资源应该能够直接转化为机器人进入新家之前就能学
Figure据此判断,如果Helix 2.5的规律能够延续,更多的数据和算力应能直接转化为更多物理世界的知识,这些知识在机器人进入新家庭之前就已习得。
是时候扩大规模了——Figure说。
- END -







