
觅蜂科技累计产出百万小时无本体数据
作者/ IT时报 沈毅斌
编辑/ 郝俊慧 孙妍
一栋办公楼里,食堂阿姨擦拭餐盘的手腕上戴着一台巴掌大的采集设备;社区的退休老人在家整理杂物,头上的轻便摄像头正记录着每一个抬手和转身的动作;奶茶店里的店员制作饮品的流程,也同步转化为一串串标注好的数据流……
过去这些只能在实验室里靠机器人遥操作零星产出的具身数据,如今正顺着轻量化的采集设备走出实验室,汇入真实世界的生产体系,成为物理AI产业最稀缺的“燃料”。
8月31日,觅蜂科技宣布第二万套MEgo无本体数据采集设备下线,累计产出百万小时无本体数据。京东、腾讯等合作伙伴共同见证,这道行业难题如何交出一份规模化的答案。


破局之后的真正考题
“物理AI最大的瓶颈,还没到算力算法阶段,数据的缺口是数量级的。”这是业内早已形成的共识。与文本、图像数据天然存在于数字世界不同,机器人需要学习的操作技能、环境认知、决策逻辑,只能从真实的物理交互中采集。在语言大模型动辄以万亿token计的训练数据面前,具身智能领域的可用数据量差了四到五个数量级。
传统真机遥操作数采模式始终困在高成本、低效率的闭环里:搭建标准化实验室场景、采购专用机器人本体、雇佣专人值守,一天8小时工作时长内有效数据往往仅1小时左右,且场景高度同质化,难以支撑通用模型对多元环境的学习需求。
觅蜂选择的无本体数据采集路径,从硬件侧打开缺口。不同于绑定特定机器人本体的遥操作数采,无本体方案直接采集人类动作数据,再通过算法重建映射到不同机器人结构,更适配通用模型预训练阶段。从6月量产到8月底,三个月两万套MEgo设备下线,这套包含头戴全景相机与腕部采集单元的轻量化设备,支持无线连接与电池快拆,不再依赖基站与厚重线束,让数据采集得以走出实验室,进入真实生产生活场景。
伴随设备规模化落地的,是百万小时级的数据积累。官方数据显示,这百万小时数据全部来自开放环境真实采集,覆盖22大类场景、500余种细分任务、5万多类物体,居住、办公、零售、生产等八大高频场景贡献约82%的数据量。技术层面,通过自研手部姿态重建算法,在遮挡、快速移动、戴手套等真实复杂场景下,手部关键点重建误差控制在5毫米以内。

但百万小时只是行业规模化的起点。在觅蜂科技董事长兼CEO姚卯青看来,从百万小时级迈向亿小时级的数据积累,无法靠现有模式线性复制完成,这才是物理AI数据赛道真正的考题。“100倍的规模增长,通过现有的模式线性复制是非常难的事情,一定要找到一个方式降维打击。”他坦言,规模跃迁的核心瓶颈不止于硬件产能,更在于运营模式的重构。
无本体数据的规模化扩张面临多重现实门槛:一方面,数据采集需要渗透进千行百业的真实场景,场景开拓、准入协调、不同行业作业流程适配,都远比搭建标准化实验室复杂;另一方面,散点式采集对资产流转效率、人员管理能力、数据质量管控提出了更高要求。设备要在不同城市、场景间高效流转,不同背景的采集者要快速达标,海量原始数据要实时完成清洗、标注与质检。
姚卯青认为,破局的核心方向是发挥众包模式的价值,让更多普通人参与数据生产,用社会化方式摊薄成本、丰富场景。

每个普通人都是“数采者”
在觅蜂的数采体系里,最核心的变化是数据生产的主体从专业采集员,变成了各行各业的普通从业者。
“现在已经不是只局限在采集厂、专业BPO公司,而是真正发动各行各业的人帮我们采集。”姚卯青透露,社区退休人员、全职宝妈、服务业一线员工,都已经成为数据采集的参与者。他们不需要懂AI技术,只需要戴上设备,正常完成自己的工作与家务,动作数据就会被自动采集、回传、处理。
这种模式的核心逻辑,是把数据采集从“专人专职的成本项”变成“顺路产出的增量项”。食堂阿姨本来就要洗碗,保洁员本来就要打扫卫生,快递员本来就要分拣包裹,在工作的同时戴上设备,8小时的工作时间里可以产出5到6小时的有效数据,效率是传统实验室遥操作的数倍,单位数据成本也随之大幅下降。


为了跑通众包模式,觅蜂采取了区域伙伴合作的轻量化策略:在各地寻找具备人力与场景资源的合作伙伴,由伙伴负责设备铺设、人员培训、日常运营,觅蜂输出标准设备、数据处理管线与质量规范,最终按有效数据小时结算费用。这种方式让企业不必直接雇用大量采集人员,也能快速拓展场景边界。
但散点式的众包天然伴随着质量管控的难题。不同的人动作节奏不同、规范程度不一,如何保证产出的数据都能被模型有效使用?
答案藏在精细化的运营设计里。比如采集人员进场前的标准化操作培训,采集过程中的过程管理。仅仅是“工作时收纳手机”这一项管理动作,就能让单人单天有效数据产出时间从1小时提升到2小时;再配合按有效小时结算的规则、达标后的阶梯返点激励,驱动参与者主动提升数据质量。后端则通过MEgo Engine数据管线对原始数据做切分、标注、质检,提出“不过滤,只分级”的原则,按数据质量、特征匹配不同的训练需求,而非简单丢弃“不完美”的真实场景数据。
隐私合规是另一道绕不开的坎。家庭场景里的个人信息、商业场景里的经营细节,都是不可触碰的红线。据介绍,目前的处理方式包括自动化人脸脱敏处理、采集前的场景授权确认,以及不同场景数据分类分级管理。但随着众包规模进一步扩大,如何在海量散点场景里持续保障数据合规,依然是整个行业需要面对的长期命题。

野蛮生长落幕
更专业成新门槛
短短半年,无本体数采赛道已经走过了野蛮生长的阶段。
“年初的时候,大家拿手机、运动相机采一采的数据都能卖,现在这一类数据需求正在逐步下降。”姚卯青的判断,折射出行业需求的快速收敛。随着头部大模型与机器人企业的需求走向专业化,60FPS帧率、双目深度、毫米级空间精度、多模态时间同步,正在成为行业共识的准入标准。
门槛提升的背后,是数据标准不统一的行业痛点。不同厂商的采集设备、标注体系、数据格式各不相同,同一家模型公司如果采购多家厂商的数据,混在一起训练效果可能大打折扣,造成大量研发浪费。就如早年自动驾驶行业的问题,硬件与标准的差异,让数据难以互通复用。
对于这个问题,觅蜂的思路是用统一标准的全量数据解决。当一家的数据规模足够大、场景覆盖足够全、标准足够统一,自然就不需要拼凑多家数据。但这也意味着,行业最终会走向集中。

“肯定会寡头分布。”姚卯青并不讳言行业终局,“本身就是重投入,吃工程能力、运营能力,同时还有资金实力。做几万套设备是几亿级的投入,背后的数据中心要存几百上千PB的数据,建一个数据中心也是几亿、十亿级的投入。”
如今的赛道上,已经出现了不同路径的玩家:海外企业以垂直场景切入众包数据平台,重金投入C端市场;国内有像京东这样兼具场景与需求的产业巨头下场自研,也有开源社区尝试用轻量化方案推动数据共享。而觅蜂的定位,是做“一站式数据服务平台”,从硬件设备、采集运营到数据处理、质量评估,提供端到端的完整交付能力。
但赛道仍处在产业早期。数据的确权、定价、流通机制还远未成熟;仿真数据、无本体数据、真机数据的最优配比,行业仍在探索;从百万小时到亿小时级的数据积累,还需要模式上的进一步突破。
“两万和一百万,是里程碑,但更像行业的分水岭。”一位业内人士评价道。当数据采集从实验室走向真实街巷,从专职人员走向普通劳动者,物理AI的“数据电网”才刚刚立下第一根电线杆。而这张网络最终能织多大、织多密,将决定中国具身智能产业能走多远。
排版/ 季嘉颖
图片/ 采访对象
来源/《IT时报》公众号vittimes
E N D

大家都在看


IT时报

怕被AI替代?
不如先学会用好它
「挨踢妹@AI茶水间」
每日投喂
扫码即可加入↓↓↓

请加「星标」不错过我们








