Token导航 LogoToken导航

以太大模型让机器人无脚本自主决策引数百万人围观

更新时间 2026-09-24来源 DeepTech深科技正文 3737字阅读约 12分钟6 张图片

图片

上海的一处户外烧烤现场,顾客们正在等烧烤上桌。现场负责服务的是两台机器人,一位守在炉前烤串,另一位穿梭在烤炉和餐桌之间,点单、传递信息、上菜。一位顾客招呼了一声:“帮我拿瓶水!”服务员就先放下手头的工作,把水递过去。递完水后,“他”便继续被打断的点单工作。

这是 9 月 16 日乐享科技在上海举行的一场户外烧烤直播里的片段。承担工作的“烧烤师傅”和“服务员”,是搭载了以太大模型(Aether)的机器人。

没有预设脚本,没有遥操作兜底,也没有剪辑掉“失误”的机会,机器人要在真实的街头环境里,自主连续完成近一小时的烧烤服务。据乐享科技介绍,这场全球首次户外机器人全自主直播,线上观看人次超过 550 万。这场近 1 小时的直播,为观察具身大模型在开放环境中的表现提供了一个窗口。在开放环境里,意外是一定会来的。这场直播真正的看点,恰恰是那些“出问题”的时刻。

图片图|乐享科技机器人在户外烧烤现场操作(来源:乐享科技)

机器人可以自己拿主意了?

直播中,负责点单、传菜的机器人被观众称为“二爷”,另一位负责烧烤的机器人,则被叫作“五弟”。当“二爷”接到顾客“少放辣”的要求后,随即用手势把这条信息传递给“五弟”。

两台机器人相互传递信息这件事,并不新奇。但是,它们怎么知道什么时候与对方交互、哪些信息需要同步?按照直播中的介绍,这场双机协作并未提前预设交互的触发条件,而是全交给机器人根据现场情况自主完成。

类似的临时变化,贯穿了整场直播。直播中,它完成送水这个临时新增任务后,继续完成了剩下的点单,没有让顾客重新点菜,也没有遗漏还没上菜的订单。取水只是顾客给机器人出的难题之一,现场参与者还可以改动订单、挪动物品,或在机器人干活时提出新要求。

这些变化有的会影响下一步操作,有的则会打断正在进行的工作。机器人需要处理眼前的新情况,也需要保留此前的任务进度:顾客还有哪些菜没点完,刚才的工作停在了哪一步,处理完临时需求后,又该从哪里接着做。

对于人类来说,这几个过程看起来很日常,也没什么难度。但是,它要求机器人能够分清临时插入的任务和原本的任务,在两者之间切换,并保留之前的任务记忆。而不是完成临时任务后,就把此前的工作一并清空。这就决定了,这场直播没法靠预设程序完成。

因为,预设流程可以覆盖一部分常见情况,但很难穷尽现场各种临时出现的变化。这场直播提供的观察窗口,正是当现场情况偏离原有安排时,机器人能否把工作继续做下去。

思考的过程,如何发生

“处理变化”对机器人来说并不新鲜。工业机器人可以依靠视觉定位与力控修正抓取位置,移动机器人能绕开路上的障碍。但当任务和场景更加多样,机器人还需要把用户的要求与眼前的环境联系起来,判断接下来该做什么、怎么做。这类变化很难仅靠预设程序逐一覆盖,它要求模型能够基于实时环境自主理解、判断和决策。

市面上的主流模型路径能完成这些目标吗?首先看视觉—语言—动作模型(VLA),它提供了一种实现方式:将场景和指令映射为动作。顾名思义,机器人会结合看到的内容和训练的指令来生成动作,它学习的是输入与动作之间的关系,能够在一定范围内泛化到新的任务或场景;实际系统也可以持续接收新画面并重新生成动作,形成反馈闭环。

以 OpenVLA 为例,它利用视觉语言模型与机器人示范数据学习动作策略,并支持在不同机器人平台上应用和适配。当你说“把杯子放到盘子旁边”,模型会结合摄像头画面和指令,输出机械臂该怎么移动、夹爪何时开合。

图片图|OpenVLA 工作原理示意图(来源:OpenVLA)

比起 VLA 的“学后做”,世界动作模型(WAM)更注重“想后做”:采取某个动作后,环境可能会发生怎样变化?这种预测可以帮助系统规划,也可以用于训练动作策略。

例如,Dreamer 通过学习环境模型,在内部预测的情境中改善行为。拿杯子来说,它可以先预测,往某个方向推,杯子会移动到哪里,继续推会不会到桌边,再根据预测的结果行动。

不过,无论是 VLA 还是世界模型,都还面临一个更难的问题:现实世界的变化几乎无法被穷举。

VLA 的能力很大程度上取决于训练数据覆盖了多少任务、场景和变化。世界模型要准确建模复杂的物理环境,需要学习大量状态变化和交互规律,数据与计算成本也随之提高。

而乐享选择的路径,更强调在目标与约束之间持续寻找可行的行动方案。仍以放杯子为例,机器人既要让杯子到达指定位置,也要考虑手臂是否够得到、移动时是否会碰到其他物品等因素,如果眼前的信息不足以作出判断,还需要补充观察。重点在于,要让这些要求共同参与动作的生成,并在执行结果返回后继续调整。

乐享提出的“能量驱动”,正是试图通过统一的能量函数,协调任务目标与不同约束。

“能量”在这里可以理解为衡量状态或方案是否合适的数值。在能量模型的一般表述中,可以用 E(x, y) 衡量已知条件 x 与候选答案 y 的匹配程度。x 代表已知条件,比如环境、任务和身体状态;y 代表待寻找的答案,比如一段动作轨迹。

按照其公开说明,以太大模型将目标完成度、物理后果、记忆一致性,以及动作能否执行、是否稳定等因素,纳入统一的能量函数,模型沿能量梯度开展持续推理、主动探索和动作生成。

图片图|能量模型的计算图(来源:Alfredo Canziani)

通俗地说,系统需要寻找一个既接近目标、又满足执行条件的方案。各种选择由统一的能量评价引导,让信息获取、任务判断与动作生成围绕共同的目标展开。

不过,评价一个方案是否合适,还需要感知、记忆和身体控制提供支持。系统要知道眼前发生了什么、此前做到了哪一步,以及这副身体能够完成哪些动作。以太大模型所强调的“仿生架构”,正是对这些功能的组织。

“仿生大脑”的经验法则

“仿生”其实是仿人,要让机器人像人一样,就得参考人的大脑。以太公开的架构图,展示了以太大模型参照脑区功能组织系统的思路。视觉、本体感知、声音指令和触觉构成输入;“上丘”模块负责主动获取信息,“角回”负责多模态感知,“内嗅皮层”负责情景记忆编码,“顶上小叶”对应动力学约束与物理后果模型;随后是负责推理与抽象的“前额叶”、规划运动轨迹的“运动皮层”和承担运动执行的“小脑”。

图片图|Aether 仿生架构(来源:以太大模型 Aether 官网)

这种分工的意义,可以从动作失误的处理来理解。抓取时出现轻微偏移,可能只需修正轨迹;如果目标超出可达范围,就需要改变站位或重新安排任务。不同程度的问题,需要影响不同层次的决策。这套仿生架构成功的关键,在于反馈能否及时到达相应模块,并带来有效调整。

如果要调整,机器人就必须对自身能力和环境同时进行评估。不同机器人的身体条件,也会改变任务的执行方式。乐享此前的居家演示,提供了一个不同本体协作的例子。

在这个 Demo 中,两台不同品牌的机器人自主协作完成了任务,身材较矮的机器人试图把围巾放到高处的柜子上,伸手却够不到。它找到旁边的箱子,尝试借此垫高,弯腰搬动未果后,又改用脚推,但仍未解决问题。随后,较高的机器人接过围巾,完成了放置。

相同任务换到不同身体上,动作方案也不相同:身高、臂长、关节范围和末端执行器,都会改变可行的路径。这段协作展示了如何利用本体之间的能力差异,继续推进工作。

图片图|两个机器人相互配合(来源:乐享科技)

这就是乐享强调的“跨本体”能力所指向的目标:让同一套模型理解共同的任务,再根据不同机器人的身体条件选择可行的动作。按照乐享对自我模型(Self Model)的介绍,系统需要表征自身的能力边界,将“任务要求做什么”与“这副身体能够怎么做”联系起来。

除了调整当前动作,乐享还希望机器人从执行中积累经验。在前述的直播中,“五弟”试图抓取一个调料瓶,最初它抓不稳,经过一次尝试后,它终于找到合适的角度,抓取也逐渐变得稳定。机器人把调料瓶越抓越稳的能力背后,对应着乐享一项与自进化相关的能力:让执行结果进入记忆与复盘,影响此后的判断和策略。

这种基于真实交互反馈、持续修正自身的过程称为“自我迭代”(Self-iteration)。机器人行动前形成预测,行动后比对结果,偏差直接驱动系统更新。新经验不会无差别写入,系统会先评估它是否可靠、能否泛化,可靠的规律才会进入长期记忆乃至模型参数。乐享团队有个更形象的说法:机器人可以给自己建“错题本”。有价值的不是记住某一次失败,而是从失败里分离出下次能用的规律。

而以太大模型的架构特色也应该放在整套系统中理解:用统一评价机制协调感知、记忆与动作,用功能分层连接任务推理和身体执行,再尝试将真实交互转化为后续可用的经验。

回到户外烧烤,机器人面对的任务变了,需要解决的问题却相通:理解新增要求,根据现场条件调整行动,并记住尚未完成的工作。直播进一步把这些能力放进了连续服务的过程,模型需要在变化不断发生的情况下,维持整个任务的进度。

虽然说,近 1 小时的直播还不足以验证长期运行的稳定性,但它提供了一个更接近实际使用的观察窗口:让外界看到,机器人能否自主判断、持续行动和进化,并把事情做完。

对具身智能而言,真正的能力边界,最终要在真实世界中被定义。机器人真正走向通用,靠的不只是学会更多任务,而是形成持续理解、判断和自我调整的能力。以太大模型正在沿着这个方向,探索具身智能的下一阶段。

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

文章标签机器人大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多