Token导航 LogoToken导航

加州理工斯坦福推HomeBody系统 让GPT Astra助力人形机器人干活

更新时间 2026-09-28来源 机器人前瞻正文 2386字阅读约 8分钟8 张图片

图片机器人前瞻(公众号:robot_pro)
作者 | 钟宸
编辑 | 漠影

机器人前瞻9月28日消息,近日,加州理工学院联合斯坦福大学推出了HomeBody系统,该系统为GPT Astra配备了持久的空间记忆能力,并且能够执行复合式人形动作,从而应对长期任务。

在一个典型的厨房场景中,HomeBody允许Unitree G1在GPT Astra的引导下在房间内进行清洁工作,同时还能从不明确的请求中找回记住的物品。

图片

论文作者表示,该系统无需针对特定环境进行训练,也无需额外的策略学习即可实现这些功能。

一、替代中间层VLA,可取药品、丢垃圾和整理东西

图片

实现人类形态机器人的自主控制通常采用一种三部分的架构:System2VLM负责处理视觉信息和指令,经过训练的System1VLA则生成控制命令,而System0控制器则负责执行协调一致的动作。

随着像Astra这样的前沿模型能力不断提升,该团队认为,在高层次推理与机器人的操作技能之间,训练过的VLA不再是必需的,System2或许能直接管理一系列可复用的运动技能。

因此,团队推出了HomeBody系统,该系统为Astra配备了持久的空间记忆能力,并且能够执行复合式人类动作,从而应对长程任务。

据悉,该系统通过一种即插即用的VLM来替代System之间的连接过程,其能够调用可组合的技能库。

清理厨房意味着需要判断哪些物品应当保留、哪些应当丢弃,以及如何将每件物品移到正确的位置。机器人每移动一次,观察到的画面都会发生变化,因此需要依靠记忆和动作反馈,持续跟踪哪些工作已经完成、哪些仍待处理。

在视频中,HomeBody将咖啡袋集中放到厨房吧台上,并丢弃指定的牛奶纸盒,协调完成在房间内多次往返、抓取和放置的动作。但HomeBody并未实现日常整理中常用的翻找或其他动作,且总体来看,整个过程花费时间较长。

在另一个视频中,药品最初并不在机器人的视野内。团队称,HomeBody利用已存储的关键帧确定抽屉的位置,取出药品并递给用户,然后丢弃饮品纸盒。

从视频来看,在房间内执行这些任务时,机器人可以实现用右手抓住抽屉把手并打开抽屉,再用左手丢弃纸盒,展现了双手协同和处理复杂任务的能力,但值得注意的是,视频经过了较高倍数的加速,任务效率仍有待提升。

二、Real2Sim训练,建立可扩展技能库

该团队也展示了自己是如何开发这一系统的。

图片

首先,该团队向人形机器人提供有关其角色的背景信息,并让它探索一个此前未见过的环境。HomeBody的空间数据采集使用了iPhone 0.5 倍镜头拍摄的视频、D435i 相机的观测数据,还结合了SLAM的激光雷达扫描数据、关节位姿,以及 Astra 选定的航路点。

从画面来看,Real2Sim有一定成效,但在一些细节方面,还是较为粗糙。

在探索过程中,HomeBody从人形机器人自身的视角记录房间,使其空间上下文建立在机器人移动并与环境交互时实际观察到的信息之上。

因此,即使物体离开了机器人的第一人称视野,HomeBody仍会保留这些上下文信息。

其次,HomeBody使用Astra作为Real2Sim智能体,根据人形机器人自行采集的数据,在Isaac Sim中构建数字孪生环境。

这一过程将机器人的观测信息对应到现实环境的空间模型中,帮助Astra对第一人称视野之外的位置进行推理。

图片

最后,就是在虚拟世界里给机器人下达指令,例如“整理厨房”。HomeBody会利用其空间上下文来选择行动和目标,而无需在行动层面编写脚本。

在技术博客里,团队也提供了一个演示demo,通过鼠标点击,即可给画面中的小机器人下达指令,例如“捡起咖啡袋、放到吧台上”,画面中它就会立刻行动起来,看起来比现实里的机器人demo更加游刃有余。

图片

整体来说,该团队就是通过Astra指挥机器人探索厨房,再用收集来的数据,Real2Sim重建数字孪生世界,并让Astra对这个世界进行探索,记录工作过程,最后在现实世界进行部署,通过可扩展的技能库来执行任务。

图片

该团队也展现了目前的技能库拥有的技能,其丰富度尚待提高。

图片

架构上,简单来说,机器人先靠语义映射地图、机器人位姿和关键帧了解环境,记住潜在上下文和记忆,当用户说一句“把药拿来,顺便收拾一下”时,GPT Astra会把这句模糊的话拆成具体步骤:取药、交给那个人、扔掉纸箱。

执行到“扔纸箱”时,Astra会从自己的“技能库”里选中“抓取”这个动作,再进一步分解为点选目标、计算抓取姿势、规划手臂轨迹、最后驱动机械臂真正伸手去抓,抓完反馈结果,继续做下一步。

也就是说,在整个过程中,不需要人下达任何精确指令,一句话就可以让机器人自己看环境、拆任务、选动作、动手做,在一定程度上体现了当前具身智能“大模型当大脑、技能库当小脑”的技术路线。

结语:Astra的具身答卷,才刚刚开始

Astra给具身行业带来的影响仍在继续。从控制机械臂到控制整个人形机器人,HomeBody再次展示了大模型在具身应用上的潜力,不针对特定环境训练、不编写动作脚本,一句模糊指令就能驱动机器人完成复合任务。

该研究团队还透露,目前为HomeBody构建的技能可以在配备RTX 4090 GPU的Razer Blade笔记本电脑上运行,同时支持感知和运动规划功能。

GPT Astra则可以通过远程方式运行,向笔记本电脑发送技能请求和目标,并接收执行结果。该团队指出,这种轻量级部署方式使得在真实环境使用HomeBody时,能够较轻松地实现本地技能执行,同时还能通过网络访问前沿模型的数据。

但是,该团队也承认,GPT Astra的推理延迟也会导致技能执行之间的停顿,这或许也是视频需要加速的原因。该团队还指出,目前,即使使用RTX 4090 GPU的笔记本来运行,如果需要添加更复杂的感知模型或技能,也可能需要更多的计算资源。

因此,想要用大模型直接操控机器人,或许还有很长的路需要走。

文章标签机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多