机器人前瞻(公众号:robot_pro)
作者 | 钟宸
编辑 | 漠影
机器人前瞻9月22日报道,昨日,理想Foundation Model团队正式发布世界动作触觉模型ME-Dex-1.0(MachEmbodied-Dex-1.0)。

该团队称,其在仿真与真机平台上评测ME-Dex-1.0,RoboTwin Clean-only Avg.成功率为78.9%,领先最强对比基线7.6个百分点,11项联合训练任务的总体成功率为65.3%,比DECO高8.9个百分点。ManiFeel平均成功率为70.0%,比官方基线高15.0个百分点。
ME-Dex-1.0将触觉从辅助条件提升为未来世界中需要预测的组成部分,统一触觉表征负责对齐异构传感器,三专家架构把预期视觉变化和接触动态连接到动作生成,数据引擎则通过规模化提供同步监督。
理想团队指出,这些组件共同为更具接触感知能力的机器人操作提供了一条可行路径。
一、展示仿真与现实环境任务能力,实现触觉可视化

理想通过相机观测与触觉图共同展示了执行过程中接触位置和受力模式的变化,视频覆盖DexJoCo、RoboTwin仿真环境中的夹爪与灵巧手,以及LeRobot SO-101 PX、Xynova Flex2两套真机系统。
在RoboTwin仿真环境中,夹爪缓缓下放,夹住了一个长方形盒子,随即右侧的触觉图发生了明显变化。

而在DexJoCo仿真环境中,灵巧手完成了拿起物品放入篮子、拿起木棍插入洞中的操作,但是为五倍速播放,整体用时可能比视频展现的时间更长。
而在真机环境下,搭载ME-DEX-1.0的Xynova Flex2灵巧手先是将手腕扭向下方,按压抽纸的一侧使其翘起,再执行抓起的操作,并最终将抽纸“扔”进方盒中,旁边的触觉图也换成了类似人手的形状,每一个区域还会随着操作不同出现具体数值的变化。

理想也展示了搭载该模型的LeRobot SO-101 PX夹爪夹取药瓶的视频。从视频来看,整个停顿较多,虽然经计算,整个流程仅有13秒钟,但视频右上角同样标注为五倍速播放,可能实际总耗时已达一分钟。
二、使用仿真数据训练,采用三专家架构
那么,这一模型是如何实现这一切的?

理想透露,ME-Dex-1.0不只把触觉作为当前条件输入,而是将其与视频共同视为需要预测的未来世界状态。
给定任务指令、当前图像、本体状态和触觉观测,该模型会联合去噪未来视频latent、未来触觉latent与动作序列。理想表示,这一设计将场景变化和接触动态直接连接到机器人控制,同时还能够保留各模态的专属表达。
理想也承认目前触觉数据十分稀缺,因此,该公司以自主式触觉数据引擎(Agentic Tactile Data Engine)扩展RoboTwin与DexJoCo的数据,通过以下两种方式进行:
- 回放已有示范动作,让仿真力传感器补录对齐的触觉信号;
- 生成并执行新轨迹,扩大任务与接触模式的覆盖范围。
理想表示,生成的数据窗口包含同步的当前观测,以及未来视频、触觉与动作目标,可直接用于联合学习。
而因为触觉数据来自于异构夹爪、灵巧手,理想称,ME-Dex-1.0将来自真实与仿真环境的夹爪、灵巧手触觉数据,映射到受人手结构启发的双手34区域模板,并通过区域掩码(mask)区分“该区域不可观测”和“已观测但未接触”,避免混淆缺失值与零受力。
此后,该公司通过共享编码器提取局部力模式,将其汇聚为标准区域token,并通过masked Transformer交换信息,解码器则用于重建力场与接触概率。
在训练中,理想会结合使用力、接触、时序变化和latent正则损失,从而在紧凑的latent空间中保留力大小、接触的支撑与过渡(force magnitude, contact support and contact transitions)。
模型架构上,理想采用了三专家模型的架构,通过视觉专家建模未来场景变化,触觉专家用于预测具有空间结构的接触动态,动作专家则生成可执行的动作序列。其透露,三个Transformer均采用条件Flow Matching优化,同时保留独立参数与隐藏维度。
该公司还采用H-Bridge共享注意力的结构技巧。跨模态交互会集中发生在选定的中间层,视觉、触觉与动作token会被投影到兼容的注意力空间完成信息交换,再返回各自的专家模型,浅层和深层则保持模态专属处理,在控制计算量的同时建立有效协同。
同时,通过联合训练与推理,未来视频、触觉和动作目标会分别加入噪声并联合去噪。推理时,三类输出从高斯噪声出发,在当前观测条件下同步演化。最终动作序列则用于机器人控制,视觉与触觉解码器则恢复对应的未来观测。
三、评测领先基线,11项任务7项排第一
理想还在仿真平台上评测了ME-Dex-1.0。
RoboTwin使用覆盖50项联合训练任务的27,500条Clean与Random轨迹,并额外以2,500条Clean轨迹评估跨配置泛化;DexJoCo包含6 项单臂、5项双臂任务共1,100条示范;ManiFeel则通过四项插入任务评估三维触觉力建模。
真机部署评测则覆盖了LeRobot SO-101 PX夹爪与Xynova Flex2灵巧手的任务执行。

结果显示,在混合训练设置下,RoboTwin加入当前触觉条件后,Random成功率由86.90%提升至89.54%;进一步加入预测未来触觉(future tactile prediction)后,成功率达到90.60%,H-Bridge共享注意力的加入最终将成功率提升至91.92%。
将当前触觉输入置零时,完整模型仍在Clean/Random上取得91.70%/91.74%的成绩,理想指出,这说明增益也来自触觉监督与未来触觉预测,而非仅依赖当前触觉的观测。

ME-Dex-1.0在DexJoCo的11项任务中,有7项排名第一,五项双臂任务平均成功率达到48.8%,高于DECO与DECO.p的39.6%。

在ManiFeel上,相比官方基线,该模型在四项任务中的三项实现领先,其中电源插头插入的成功率由58.0%提升至88.0%。
理想还进行了定性分析,称该模型相比对比模型效果更好。

在RoboTwin中,ME-DEX-1.0可以在两个基线模型失败的情况下,完成抽屉放置和物体扫描的任务。

而在DexJoCo中,理想称,ME-Dex-1.0在插销装配和iPad密码输入任务上,展现出了更有效的双手协同。
理想还展示了下一阶段将聚焦的研究与目标:
- 扩大触觉预训练:后续将扩展跨平台触觉数据,并评估模型对未知传感布局与机器人本体的泛化能力。
- 更快的接触反馈:未来将研究触觉驱动的局部反馈控制,通过在执行过程中进行高频修正,提升精细操作的响应速度与准确性。
结语:触觉不止于标配,或将成为模型预测的一部分
过去两年,VLA模型让机器人”看懂”了世界,但操作的成败往往藏在指尖。
ME-Dex-1.0的思路是:未来视频可以预测,未来触觉同样可以预测,而且预测的不是抽象数值,而是接触动态如何连接到下一步动作。
结果验证了这条路,这一模型在评测结果上展现了领先水平。
但是,这并不代表世界模型解决了触觉预训练规模、跨平台泛化、真机实时性等问题,具身大模型的竞争,正从眼睛和大脑卷向“指尖的触觉”。让模型主动预测接触而非被动接收触觉,很可能成为下一代世界-动作模型的标配。







