Token导航 LogoToken导航

觅蜂科技发布觅蜂派具身数据众包采集平台

更新时间 2026-09-23来源 北京商报正文 2441字阅读约 8分钟1 张图片

具身智能产业数据供给紧缺,数据商的“触手”开始伸向千行百业、找到打工人。

继海外Figure公司8月发布Index平台、通过向全球用户付费采集真实任务视频来构建训练数据集之后,9月23日下午,觅蜂科技“觅蜂派”具身数据众包采集平台在上海正式对外发布。

团队告诉北京商报记者,不同于Index主要服务Figure自身模型训练,觅蜂派希望面向不同模型厂商和机器人企业,根据客户需求组织数据生产,覆盖更广的行业场景。

公司董事长兼CEO姚卯青的另一个身份,是智元机器人的联合创始人。从具身智能头部公司到为具身智能等产业提供“原料”的物理AI数据服务平台,姚卯青告诉北京商报记者,团队希望把普通人日常工作中的操作动作采集下来,转化成机器人训练所需的数据、机器人的“教材”。

随平台发布,“机器人训练师”这一职业概念被推出。对参与者而言,是在本职工作之外多一份收入;对机器人产业而言,则是一个规模化填补数据缺口的解法。

图片

 01、从实验室到工作间

过去三年,具身智能行业从开发态逐步迈入部署态,机器人开始从实验室走向真实场景,但数据瓶颈始终绕不开。

行业此前通行的做法是真机遥操——人通过手柄或VR(虚拟现实)设备操纵机器人,把任务“示范”给模型。这类数据与机器人本体对齐度高,但采集速度受限于机器人数量、操作人员和场地,硬件、人力与运营成本也随规模同步增长。

近段时间,一种分工模式被各具身智能本体及模型厂商频繁提及:无本体采集拓展规模与场景,真机遥操提供贴近本体的数据,真实部署帮助模型持续修正。

所谓“无本体”,即采集不依赖特定机器人,而是先记录人的真实操作,再经过轨迹重建和动作转换,适配不同模型和机器人,觅蜂派应这类需求而生。

平台由自研MEgo数采设备、觅蜂派App和数据治理引擎MEgo Engine三部分组成。用户通过App领取采集任务,佩戴数采设备在零售、仓储、制造、家庭等场景中完成指定操作,按审核后的有效时长获得报酬。

采集完成后,MEgo Engine负责数据处理、标注、质量评估和交付,把真实操作拆解为抓、拿、放、拧、按等120多种标准原子动作,再经过位姿重建与动作映射,转化为模型可训练的数据。

据觅蜂科技披露,觅蜂派目前已经覆盖了22大类场景、5000多个任务和50000多个真实环境,涵盖物流、仓储、住宿、餐饮、零售、养老、医疗、农业、非遗等方向。8月31日,第20000套MEgo采集设备下线,累计生产超过100万小时真实世界无本体数据。

02、为何需要众包“机器人训练师”

在正式发布前,觅蜂派经历了一个月的内测。据披露,内测期间注册用户数达2万人,累计产生1.3万份采集任务提交。

经北京商报记者现场实测,觅蜂派App上的设备租金定价为39元/天,发布会推广期内折扣价为19元/天。觅蜂派业务副总裁张智富向北京商报记者表示,收取设备使用费的目的不为盈利,仅是设置一道门槛——如果设备免费发放,用户可能不会认真使用。后续平台或将会根据采集者的有效时长和数据质量给予动态补贴,逐步降低活跃采集者的设备成本。

相比于业务推广环节的变量,众包平台在数据量层面带来的增量是团队更为看重的。

姚卯青向北京商报记者表示,百万小时对当下的市场需求已经不够用,不少模型公司的数据需求量已达数百万小时量级。当前阶段的瓶颈不只是数量,还包括场景丰富度——家庭叠衣服这类数据已经趋于饱和,而修水管、修车、理发、美甲等专业技能场景,靠集中式团队去拓展效率低,众包模式更灵活。他同时表示,目前整套采集硬件和数据处理流程已实现标准化,基础质量有保障,众包主要解决的是“场景进得去”的问题。

并且,众包模式带来的商业化闭环也较为快速。姚卯青称,众包模式本身降低了采集端的人力成本——采集者是在日常工作中顺便完成数据记录,而非专职雇佣;后处理环节通过自研模型和自建数据中心持续优化,数据量越大,自动化程度越高,人工标注占比越低。他表示,目前数据产品对外销售已有不错的毛利率。

不过,众包模式下如何管理大量分散的C端采集者,仍是一个开放问题。张智富坦言,众包C端用户的管理本身难度很大,对比外卖行业经过近十年迭代才建立起可靠的配套体系,觅蜂派的全链路体系仍在持续完善中。

03、 数据质量仍是考题

众包模式能快速扩大数据产能,但质量控制挑战仍无法回避。

对于业界关心的数据质量问题,姚卯青进一步解释称,采集任务上传后,平台会在一天内通过自动化方法完成初筛和结算,切掉明显无效的数据;结算环节通过后,还会经过轨迹提取、人工抽检等后续处理。他表示,通过结算环节的数据,最终可用率超过95%。并且,平台不会把数据简单分为“好”与“坏”、“0”或“1”,而是按质量分级,匹配不同模型训练阶段的需求。

一个行业此前普遍存在的争议是:部分第一视角采集要求参与者放慢动作、保持手部持续可见、按固定流程执行,因为这类数据更容易被现有算法解析。但当人开始“迁就算法”,真实世界中快速运动、遮挡、自然纠错和非标准操作会随之减少,模型看到的行为分布可能被人为收窄,导致并不足够“真实”“现实”。于机器人而言,容易处理也不意味着训练价值更高。

觅蜂对数据质量的应对包括两层。一是硬件层面,MEgo设备以多视角、多模态采集尽可能减少视觉、触觉和姿态之间的偏差;二是软件层面,MEgo Engine完成位姿重建与动作映射,配合ManiEval多维度质检体系,从数据格式、任务完整性、传感器质量、语义准确性和动作可学习性等方面进行评估。

据披露,觅蜂的百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等客户。中国信息通信研究院人工智能研究所具身智能与机器人部副主任张蔚敏在发布会上表示,众包数据平台的价值不只是汇集大量记录,更在于通过任务组织、数据工程、质量控制和闭环运营,将分散的数据转化为可训练、可评测的数据资产。

至于众包模式能否持续稳定地交付高质量数据,“机器人训练师”能否从发布会上的证书变成一份真正可持续的工作,还需要更长时间的检验。

北京商报记者 王天逸

文章标签机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多