杰西卡 发自 ROBO-智
量子位ROBO | 公众号 AI4ROBO
理想的具身智能研发,开始集中交卷了。
而且这次交出的不是单点能力,而是一整套覆盖机器人大脑、统一模型、端侧部署和触觉操作的技术成果。
理想最新发布了MachEmbodied系列四份技术报告:ME-Brain-1.0、ME-VLM、ME-U0和ME-Dex-1.0。
四篇工作各有分工:
- ME-Brain搭建记忆、认知与行动协作的系统;
- ME-VLM提供其中的核心认知能力;
- ME-U0把任务理解、未来预测和动作生成放进统一模型;
- ME-Dex则进一步把触觉纳入预测范围。
同时,理想已经开始把机器人的核心“大脑”真正搬到本地芯片上。ME-Brain的记忆、认知和行动三大模块,都完成了马赫M100上的迁移和优化,ME-VLM 4B的预填充时延从400毫秒降到188毫秒。
对机器人来说,这意味着长期记忆、环境理解和任务决策不再只能依赖云端算力,理想开始把一套完整的具身智能系统,往可本地运行的方向推进。
从物理感知、记忆与认知,到统一模型、触觉和端侧部署,理想由此勾勒出了一整套具身智能技术成果。
先让机器人记住,再让记忆真正管用
让机器人记住过去,看起来似乎只要把历史视频存下来就行。但用的时候,问题才刚开始。
比如,让机器人拿起杯子,换好桌布,再把杯子放回原处。
如果只记下一句“杯子原来在桌上”,记忆虽然没错,却不足以指导最后一次放置,机器人还需要原来的具体位置,以及当时的视觉和空间信息。
ME-Brain的可进化记忆,就是围绕这种需求设计的。
它把经历放进独立于模型上下文窗口的外部记忆结构:
近期的图像、动作和状态先保存在短期记忆中;抓取、放置、失败等关键事件被整理进中期记忆;反复出现的成功条件、失败模式,再沉淀为可以跨任务复用的长期经验。

这些记录之间还保留关联。系统既能读到一次任务的概要,也能沿着概要找到具体操作时的场景和结果,避免记忆越压缩,越丢失真正有用的细节。
调取记忆同样讲究分工。负责规划的模块要知道任务进展到哪一步,负责动作的模块则可能只需要某个物体之前的位置。
ME-Brain因此按用途检索相关记录,把需要的信息送到对应模块。
论文开头的移杯演示,就能说明这套机制的作用:当前画面无法定位方块,历史观察补上了缺失的信息,推理结果再变成移开左侧杯子的实际动作。
理想尝试的另一个演示中,用户只说“把桌面恢复成之前的样子”,系统便从记忆中找回玩具和小车原来所在的篮子,再分别放回去。

不过,记得多,不代表每次都能做对。执行失败之后,还需要判断问题出在哪里,决定是重新定位物体、修改计划,还是调整动作。
这就轮到认知核心出场了。它负责理解现场、拆解任务、调用技能、验证结果,并把执行结果和失败原因写回记忆。动作模型则负责把这些决策变成机器人控制指令。

一次执行留下记录,记录被整理成经验,经验再影响下一次执行。这就是ME-Brain所说的“部署后进化”。
这里更新的主要是外部记忆、技能库和规划依据,不需要每积累一批新经历,就重新训练模型参数。
这套系统的认知模型,也被理想单独写成了另一篇报告:ME-VLM。
和更偏图文理解的传统 VLM 相比,ME-VLM 把重点进一步放到了物理世界的感知和时空理解上。
机器人不仅要识别眼前有什么,还要判断物体处于什么状态、空间关系怎样变化,以及自己的动作究竟产生了什么结果。
比如夹爪合上,并不代表物体已经抓稳;抓取动作发出之后,模型还要继续观察物体是否被抬起、是否滑落,再判断任务是否可以进入下一步。

在此基础上,ME-VLM又加入了任务规划、工具与技能调用、结果验证和反馈纠错等Agent能力。物理感知负责理解真实环境,Agent能力再基于这些信息组织后续任务,两部分最终被整合进同一个模型。
训练时,团队分别强化具身认知专家和多模态Agent专家,再通过多教师策略蒸馏,将两类能力合并到最终模型中。

按报告中的评测口径,ME-VLM 35B-A3B版本在具身基准上的平均分为70.9,比表中最强对照模型高8.2分;在智能体基准上平均分为72.5,高出9.6分。

回到真实操作,ME-Brain在Piper双臂机器人上的六项任务中,平均成功率达到66.7%,对照模型DM0.5为55.0%。每项任务测试十次,叠碗十次全部成功,不过插充电器只有一次成功。
这组结果既说明系统有进展,也把难点摆了出来:能记住、会规划之后,精细动作仍然是一道需要单独攻克的关。
把机器人大脑放到本地芯片
机器人要真正长期运行,记忆、认知和动作能力,最终都需要面对本地算力约束。
据理想方面介绍,其已经率先将机器人的认知和记忆能力部署到本地芯片。
理想把ME-Brain的记忆、认知和行动三大模块迁移到了自研的马赫M100,并围绕端侧运行进一步压缩计算开销。
也就是说,机器人的记忆、认知和行动链路,已经开始从云端模型和离线实验真正落到本地芯片。机器人可以更持续地保存和调用自身经验,也让认知与动作之间的反馈链路更短。
为了适应端侧算力,模型本身也在做针对性收缩。
ME-Brain的EventCell把世界预测集中在真正发生交互的局部区域。在论文给出的三视角、十个未来窗口设置下,世界表征token从1920 个降到270个,减少约85.9%。

动作时间轴也做了类似处理:减少几乎不动、重复变化的状态,把预测集中在关节和夹爪发生明显变化的关键帧上。
读取历史时,则由动作模块从独立记忆库中选择相关证据,避免每次都把越来越长的历史塞进视觉语言模型。
这种取舍也延伸到了端侧部署。报告称,ME-Brain的记忆、认知和行动三大模块,都已完成在理想马赫M100芯片上的迁移与优化,能够分别在端侧运行。
其中,ME-VLM 4B给出了具体时延数据。团队压缩重复的视觉token,采用W4A8量化再配合芯片编译和运行调度优化,将预填充时延从400毫秒降到了188毫秒,下降约53%。

这背后其实体现出一个很明显的工程方向:具身模型开始和芯片共同设计。
模型需要什么样的计算,以及芯片能够提供怎样的算力和带宽,两边开始互相约束。
对于理想来说,马赫M100原本服务于车端AI,现在又被进一步用来承载机器人的认知、记忆和行动模块。汽车时代积累的端侧算力、编译优化和软硬件协同能力,如今也开始延伸到机器人了。
把理解和动作接起来,还要预测动作的后果
ME-Brain解决了系统如何组织能力的问题,ME-U0则进一步研究:能否把更多能力统一进一个可扩展的预训练模型?
先看两条已有路径:
VLA根据画面和指令生成动作,擅长利用预训练模型的语义知识;世界动作模型把未来视觉状态与动作一起预测,让控制学习同时接受环境变化的监督。

两者各有长处,也留下了一个衔接问题。
理解“把杯子放进盒子”,不代表知道眼下应该先抓杯子还是寻找盒口;生成一段看着合理的未来画面,也不代表交互位置足够准确。
ME-U0把这个过程拆成了四个相互关联的问题:接下来做什么、在哪里操作、场景会怎样变化,以及具体如何运动。
它采用混合Transformer架构,让不同专家保留各自的处理能力,并通过共享注意力交换信息。
理解专家负责识别当前子任务和可供性(后者指物体或区域能支持什么操作,以及适合从哪里交互);生成专家则利用这些语义和空间信息,联合预测未来视觉变化与机器人动作。

比如抓杯子,模型需要把“抓取”这个意图,落实到当前画面里的具体目标和交互位置,再让动作生成与预期的物体运动相互配合。
视觉预测也不局限于彩色画面。ME-U0还学习了深度,即场景中各点与相机的距离;表面法向,即物体表面的朝向;以及光流,即画面中各点在相邻帧之间的运动。
它们分别补充几何和运动信息,让训练目标更贴近实际操作需要。
模型按提示选择要生成的视觉模态,并将它与动作联合生成。这背后涉及流匹配(一种学习如何把噪声逐步变成目标数据的生成方法),用于生成视觉表征和连续动作。
还有一个容易忽略的工程问题:视频可以隔几帧看一次,动作却需要更密集的控制。
为此,ME-U0采用了多速率旋转位置编码,在对齐视频与动作时间关系的同时,保留同一段视频对应的多个动作之间的先后顺序。
支撑这些能力的,是约4200小时筛选后的机器人与第一视角演示数据。团队既统一不同机器人的状态、动作单位和控制语义,也筛除异常轨迹,并补充子任务、交互位置、几何和运动标注。

那么结果如何呢?
完成相应后训练之后,ME-U0在标准LIBERO机器人操作基准上的平均成功率达到99.1%。
换到引入视角、光照、语言、布局等扰动的LIBERO-Plus,同一套权重、不做该基准专项适配,在10030个测试实例上的平均成功率为81.8%。
在更复杂的RoboDojo中,ME-U0的整体过程得分为17.66,即按任务推进程度计分;完整任务成功率则为11.18%。其过程得分在论文列出的WAM组中最高。
精细操作的下一关:让模型理解接触
只是看清物体的位置,仍然不能解决所有操作问题。
插头和插座对准了,继续推进时究竟是顺利插入,还是顶到了边缘?摄像头有时很难直接看出差别,力的变化却能提供新的证据。
ME-Dex-1.0研究的就是这一层:把未来触觉和未来视频一起预测,让动作模型学习接触如何发生、如何变化。

触觉在这里既是输入,也是模型需要学习预测的结果。模型需要把自己将要执行的动作,与接下来可能出现的受力变化联系起来。
而真要实现起来,首先要面对的一关就是数据格式。
两指夹爪和五指灵巧手的形状不同,传感器数量、位置和覆盖区域也不同。同一个数值,出现在指尖还是手掌上,物理意义并不一样。
ME-Dex为此设计了标准手模型,给不同硬件的触觉测量建立共同的空间参照。五指手映射到相应手指和手掌区域,两指夹爪则映射到拇指和食指区域。
没有传感器的位置会被单独标记,避免把“没有测量”误认为“测到了零接触”。

随后,统一触觉自编码器把不同布局的信号压缩成可共享的内部表征,同时学习保留接触位置、力的大小和接触变化。
在模型层面,视频、触觉、动作三个专家分别负责预测,再通过H-Bridge共享注意力——一种在网络中间层交换不同模态信息的机制——协同生成。
动作专家由此可以在生成过程中,利用未来视觉和未来接触状态的中间表征。

数据不够的问题,则交给触觉数据引擎处理。
理想团队把已有机器人轨迹放回仿真环境中执行,通过仿真力传感器记录触觉,再与视觉和动作按时间对齐。补出来的是仿真接触数据,其价值在于让原本缺少触觉的数据集也能参与联合训练。
实验里,还有一个值得关注的结果是,触觉并非加上去就一定有效。
在RoboTwin的随机场景测试中,ME-Dex自身的模型对比显示,从只建模视频和动作开始,加入当前触觉、进一步联合预测未来触觉,再使用H-Bridge,成功率依次从86.90%升到89.54%、90.60%和91.92%。
在DexJoCo的11项灵巧手仿真任务中,ME-Dex的平均成功率为65.3%,比表中最强基线高7.5个百分点;其中五项双手任务平均达到48.8%。
在ManiFeel的四项插拔、装配仿真任务中,平均成功率为70.0%,比官方基线高15个百分点。

而最终把四篇论文放在一起,就能看出理想对机器人能力建设的分层思路了。
理想展开具身路线图
理想将其路线图划分出了三层:
- 短期由ME-Brain和ME-VLM面向可运行的系统闭环及端侧部署;
- 中期由ME-U0探索可继续扩展的统一预训练基座;
- 更长期则由ME-Dex推进力触感知与灵巧操作。
三层分别对应了具身智能当下需要应对的三个问题
第一层,是先让机器人形成一个能真正运行起来的大脑系统;第二层,是把原本分散的能力进一步统一起来;第三层就是继续走向更加细腻的物理交互。
而把视野放到整个具身智能行业,这种分层其实也对应着行业正在经历变化。
前一阶段,机器人竞争很大程度集中在单模型能力上,随着模型开始真正进入机器人,问题正在快速从模型能力扩展到完整系统能力。

最终决定实际体验的,更接近于一条完整技术链条。
这也在重新定义具身智能的技术门槛。
机器人一旦进入长期部署阶段,真正难复制的部分会逐渐沉到系统内部。
训练一次模型可以带来一轮能力提升,持续运行却要求机器人把真实交互转化为可复用经验,并在新的任务和环境里继续调用这些经验。
真正的分水岭,或许依旧是在长期运行中积累经验,并把这些经验稳定地转化成下一次行动。
项目官网:machembodied.com
ME-Brain-1.0:https://machembodied.com/ME-Brain/ME-Brain-1.0.html
ME-VLM:https://machembodied.com/ME-Brain/ME-VLM.html
ME-U0:https://machembodied.com/ME-U/ME-U0.html
ME-Dex-1.0:https://machembodied.com/ME-Dex/ME-Dex1.0.html
ME-U0代码仓库:https://github.com/MachEmbodied/ME-U0
ME-Dex代码仓库:https://github.com/MachEmbodied/ME-Dex-1.0







