Token导航 LogoToken导航TokenDH.com

机器人数据采集门槛大幅降低!大晓机器人首创双手3D手形重建

更新时间 2026-09-04来源 IT时报正文 2126字阅读约 7分钟3 张图片

IT时报记者 孙妍

近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学等机构,开源了第一视角视频的3D双手形状重建模型ACE-Ego-Hand,并已产出约5000小时训练数据。

ACE-Ego-Hand可从海量第一视角视频中高效提取结构化的双手三维操作轨迹,将人类真实的抓取、装配和双手协同经验转化为机器人可学习的大规模数据,成为具身大模型训练数据的重要组成部分。它还首次将视频生成模型作为DreamHand编码器,实现端到端训练,只需对整段视频进行一次分析,就能直接输出双手的姿态、形状和3D位置。

与此此前依赖逐帧检测、窗口式时序回归或多步骤扩散采样的手部模型相比,ACE-Ego-Hand将视频扩散模型改造成几何编码器,单次前馈恢复连续的双手3D轨迹,降低了推理延迟和误差累积,使模型能够利用完整视频片段中的上下文信息恢复被遮挡或暂时离开视野的手形轨迹。

对于产业而言,ACE-Ego-Hand的价值不只是提升单帧手部姿态识别精度,而是将第一视角视频转化为连续、稳定且具有度量尺度的双手3D轨迹。它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建等场景。尤其是在手部经常被工件遮挡、暂时离开画面以及相机快速运动的真实环境中,模型能够减少轨迹中断和手部丢失,为机器人从人类操作视频中学习完整动作过程提供数据基础。

从公开评测结果看,ACE-Ego-Hand在ARCTIC、HOT3D、HOI4D、H2O和OakInk2五个第一视角手部基准上取得领先表现,在论文报告的48项主要指标比较中赢得45项。

图片

不再反复去噪 手部3D恢复提速33倍

图片

ACE-Ego-Hand首先解决的是手部3D恢复过程中的效率问题。传统视频扩散模型通常需要经过多步去噪采样,逐步生成中间视频或像素结果,再从生成结果中估计手部姿态。这种流程不仅计算成本高,也会增加生成误差向后续姿态估计传播的风险。

ACE-Ego-Hand去掉了这一多步骤去噪过程,不再将视频扩散模型作为像素空间的生成器使用,而是将其改造成确定性的几何编码器。这种设计将原本"多步去噪生成视频,再进行手部估计"的流程,压缩为"单次前馈传播,直接恢复手部3D运动"。模型不需要反复生成RGB视频,也不依赖外部手部检测器和额外的逐帧裁剪,从而显著减少了推理环节和计算开销。

在单张A100 GPU上,ACE-Ego-Hand达到约63.1 fps,约为ViDiHand高精度配置下的33倍效率,为大规模处理产线第一视角操作视频提供了效率基础。

告别手形遮挡帧丢失 利用视频上下文补全离屏轨迹

图片

ACE-Ego-Hand另一核心创新是在手部被遮挡或离开视野后,推理恢复其运动轨迹。

这一能力来自模型的双向时空推理机制。传统因果模型主要根据过去帧预测当前结果,手部离开画面后只能进行单向外推,容易产生漂移。ACE-Ego-Hand则对整段视频进行联合分析,不使用因果掩码,因此处理某个时刻时,可以同时利用手部消失前和重新出现后的信息。

实际操作中,手部被工件遮挡并不是偶发情况,而是装配、抓取和工具使用过程中的常见状态。对于机器人学习来说,完整的连续轨迹通常比若干张孤立的高质量单帧结果更有价值,因为机器人需要学习的是动作过程,而不是单个姿态。

在离屏手部评测中,ACE-Ego-Hand在ARCTIC和HOT3D上相较ViDiHand的综合误差分别降低45.9%和61.1%,说明其优势不仅体现在可见帧的姿态估计,也体现在对不可见运动过程的恢复能力上。

利用头部第一视角 恢复手部3D位置

ACE-Ego-Hand的一项关键能力,是在测试阶段无需显式输入相机内参,仅通过头戴式第一视角视频,即可恢复手部在相机坐标系下的度量3D位置。

此外,ACE-Ego-Hand支持原生鱼眼超广角输入,面对鱼眼图像显著的径向畸变,模型无需提前标定相机、做图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成手部度量3D位置恢复。模型不仅判断"手在画面中的哪里",还进一步估计"手距离相机多远",实现从二维定位到度量3D运动恢复的扩展。

这意味着,手部模型不必完全绑定在某一台固定相机或某一套标定参数上,可以更灵活地适应人员移动、头部转动和采集视角变化。模型输出的不只是手部在画面中的二维位置,而是可进一步用于机器人示教、轨迹重定向和模仿学习的3D手部运动数据。

五个基准测试SOTA 45项能力领先

DreamHand在5个第一视角手部基准上进行了评测,覆盖双手遮挡、复杂相机运动、手物交互和长时序操作等场景。在这48项主要指标比较中,ACE-Ego-Hand赢得45项,整体表现领先现有方法。其中,在五个基准测试指标上超过此前最佳方法。

ACE-Ego-Hand最大的产业价值,是降低机器人操作数据的采集门槛。企业可以通过头戴式相机记录真实产线操作,再将视频批量转换为机器人可用的3D动作数据,用于机器人示教和灵巧手模仿学习。

这为未来训练具身大模型提供了更具规模的数据来源:将大量真实的人类操作视频转化为连续、结构化的双手运动数据,让具身模型能够学习更多任务、工具使用方式和双手协同技能,加快从人类操作经验到机器人能力的转化。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多