
本报(chinatimes.net.cn)记者石飞月 上海报道
“把生活兼顾了,还能有一份额外收入,是双倍开心的事情。”42岁的网约车运营人员李国英说。一个月前,她第一次戴上觅蜂MEgo数采设备,记录浇花、擦玻璃、整理桌面和文件的过程,之后,她将数据上传至觅蜂派App,通过审核后获得任务收益。此后,她开始利用下班后的时间,在做家务时完成采集。
像这样来自日常生活和不同职业岗位的操作,对很多人来说已经习以为常,机器人却需要大量数据才能逐步掌握。为解决这个问题,9月23日,觅蜂科技发布全球首个全品类高质量物理AI数据众包服务平台“觅蜂派”,面向社会开放物理AI数据采集任务。李国英就是“觅蜂派”发布前期的内测人员之一。
众包破局具身数据采集
经过过去三年的发展,机器人已经逐步从实验室走向真实场景,但这条路走得并不顺利。根本原因在于,机器人的“大脑”(具身模型)还不够聪明。
这是因为,具身模型的先天条件远不及拥有海量文字语料的大语言模型,抓起杯子、拧开瓶盖、折好衣服,这些每天重复无数次的动作,至今仍没有形成可以直接用于训练的大规模数据。因此,具身模型首先要解决的,是如何把现实世界中的交互行为持续转化为数据。
行业此前较为通行的解法是真机遥操,即人通过手柄、VR设备或其他控制系统操纵机器人,把一个个任务“示范”给模型,这类数据与机器人本体高度对齐,训练价值较高,但硬件、人力与运营成本也会随着数据规模同步增加。
在此背景下,觅蜂科技决定采用众包的数据采集方式,正式发布物理AI数据众包服务平台“觅蜂派”。
所谓众包,就是用户通过觅蜂派App领取数据采集任务,佩戴MEgo设备在零售、仓储、制造、家庭等真实场景中完成指定操作,按照审核后的有效数据时长即可获得相应报酬,成为一名“机器人训练师”。
在文渊智库创始人王超看来,相比专业集采,众包有几个明显优势:规模上限更高、数据多样性更强、成本结构改变。
“规模上,专业集采的瓶颈往往不是算法,而是人、机器和场地,一台机器人一天能采的数据有上限,而众包理论上整体上限是无穷的;多样性上,机器人最缺的不是在简单动作上重复一万遍,而是在一万个不同的小场景里分别做同一个动作,真实世界的长尾场景是集中实验室里极难制造的。”王超对《华夏时报》记者表示,且数据工厂固定成本很高,众包则变成按有效数据付费的弹性供给模式。
在他看来,众包解决的是数据的广度,专业集采解决的是数据的精度,二者都不可或缺。未来的逻辑是,人类数据告诉机器人“大致该怎么干”,解决方向问题,真机数据告诉机器人,作为一个和人不一样的个体,很多动作到底能不能做,又该怎么做。
而这就是物理AI和大语言模型的不同:语言模型可以通过互联网学习,但机器人必须接受物理世界的考试。
其实在正式发布“觅蜂派”之前,觅蜂科技董事长兼CEO姚卯青透露,该公司已经进行了为期一个月的内测,这期间,“觅蜂派”注册用户数达2万人,累计产生1.3万份采集任务提交,首批参与者来自不同年龄和职业,他们将日常劳动与专业技能转化为机器人训练数据。
那么,在进行了一个月的内测后,供给侧与需求侧的匹配效率如何呢?觅蜂科技觅蜂派业务副总裁张智富向本报记者坦言,关于人和场景之间如何合理匹配,这项工作任重道远。“我们希望未来做到千人千面,按职业背景和做单行为打标签,向数据采集人推更合适的任务,但平台穷举需求不可能全,所以要开放反向申报,让手握场景资源的人主动上报,平台审核后对接需求方。这样觅蜂派就能从‘平台统一派单’走向‘人群精准匹配+反向申报+平台审核撮合’的双向机制。”
如何保证优质性和隐私
事实上,众包模式的数据采集并不是觅蜂科技首次提出。今年8月,Figure发布的Index,就是通过向全球用户付费采集真实任务视频,来构建多样化训练数据集。因此,“觅蜂派”也被业界视为“中国版Index”。
不过,虽然同样是把众包模式引入具身数采,但二者的路子有所差异。不同之处在于,觅蜂派面向的是更广泛的行业需求,包括服务不同模型厂商、机器人企业和数据采购方,根据客户需求组织数据生产,并将处理后的数据作为服务对外交付。
这也意味着,觅蜂派需要接收和处理更复杂的数据,如何保证数据的优质性就成为一个关键问题。
“我们会用自动化方法对采集时长做有效环节提取,手部不在画面内、在休息、动作不规范,或主观重复做无效动作,这些都会被切掉。切分后先以此为基础做结算,之后再经过标注、轨迹提取等更细致的数据处理,最后还有人工抽检。”姚卯青解释道,数据损耗不会太大,自动质检的准确率和召回率已提升到较高水平,过了结算环节后,超过95%的数据仍能被用起来。
此外,觅蜂科技不会把数据做非黑即白的区分。在姚卯青看来,数据质量可以分很多层,根据不同下游模型类型和训练阶段,可以分别利用不同质量等级的数据,所以平台会给数据贴上质量标签,尽可能把它们保留下来。
采用众包形式,采集又涉及大众的日常生活,隐私问题势必也无法回避,觅蜂科技要如何保证采集人的隐私不被泄露呢?姚卯青就此回应称,“觅蜂派”会对采集到的数据进行自动化脱敏,不需要员工手动一张张人脸、一帧帧打马赛克,所以这些信息不会经过后台员工,也不会被看到。
当然,即便走的是众包这种广撒网的路子,要想让具身智能真正实现质的跨越,也绝非易事——它依然是一场硬仗。8月31日,觅蜂科技宣布第20000套MEgo采集设备下线,累计生产超过100万小时真实世界无本体数据。业界普遍认为,如果要实现具身AGI,需要的数据至少要从百万小时扩展为亿级小时。
但只有觅蜂科技一家,显然无法覆盖海量数据。9月23日,觅蜂派发起“场景数据联盟”,联合场景方、采集网络、机器人及模型企业,推动场景需求、数据采集、模型训练和落地验证形成闭环。联盟首批成员覆盖零售商超、酒店文旅、餐饮服务、养护院、智慧生活、医疗健康、地产制造和城市物业等领域,包括东呈酒店、中旅集团、陈香贵、浦商生鲜超市、普善养护院、上海德济医院、正荣集团、龙旗科技、海天瑞声、张江集团等50余家企业和机构。
责任编辑:黄兴利 主编:寒丰







