
文 | 周小燕
编辑|徐青阳
宝妈收拾房间、店员整理货架、木匠刨木头——这些再普通不过的日常动作,正在变成机器人训练的数据。
9月23日,觅蜂科技发布数据众包产品“觅蜂派”,宝妈、店员、手艺人都可以戴上觅蜂科技的MEgo采集设备,完成他们的日常工作,这些任务通过设备的传输,都可以变成机器人训练需要的数据。
一个人干了十几年形成的手感、习惯,甚至近似于“肌肉记忆”的经验,就这样被“蒸馏”出来,喂给机器人。
这种模式让人想起移动互联网早期的一段历史。
公众号刚兴起时,曾出现过一种“草根”感十足的内容生产链:前台是看起来专业、光鲜的公众号,后台却可能是一套成熟的模板,再加上一群劳动力成本低廉的普通写手。内容生产第一次被大规模拆解、外包给普通人。
到了AI时代,类似的生产方式又出现了。只不过这一次,普通人贡献的不再是文字,而是自己的生活和手艺。
觅蜂科技想发动更多人成为机器人的“数据采集师”。“全民参与才能带来高质量,就像自媒体,人人都能分享精彩的生活片段。”觅蜂科技董事长兼CEO姚卯青表示。
那么,这种众包数据搜集的模式,如何运转?它对于整个数据稀缺的机器人行业而言,又有什么样的价值?
01 采数据拿补贴,月入5000块?
无论是做家务还是上班干活,现在多戴一套数据采集设备,一个月就可能多赚5000多块钱。
这是姚卯青在现场展示的“觅蜂派”App用户收入榜单中,8月15日至9月15日的最高收入。

赚钱的方式并不复杂,只需要把自己做事的过程记录下来,作为机器人学习的素材。以现场展示的制作糖画为例,用户在“觅蜂派”App上接下任务后,戴上MEgo头盔,两只手腕各绑上带摄像头的腕带,就可以照常制作糖画。头部的5个摄像头和双侧腕带的2个摄像头,会从不同角度记录整个过程。

但一个月实际能赚多少,还得算一笔账:任务报酬减去设备租金,才是到手的收入。
从现场观察来看,不少任务的单笔报酬在十几元至二十元左右,最终结算,要看上传的数据中有多少“有效时长”。姚卯青介绍,平台会先通过自动化质检,切掉手部不在画面内、休息,以及无效重复动作等片段,再以剩下的有效时长为基础结算,大约在一天内反馈结果。审核通过后,用户可以在收益界面查看报酬并提现。
数据标注、轨迹提取和人工抽检,则在结算后继续进行。据姚卯青介绍,通过结算环节的数据,最终能被利用的比例超过95%。
对用户而言,使用成本主要来自设备租金。目前,觅蜂科技的MEGo头戴式设备使用费为39元/天,在9月23日至10月22日推广期间降至19元/天。按优惠价连续租用30天,用户需支付570元。
与此同时,在发布会上,觅蜂科技宣布启动“亿元补贴计划”,补贴覆盖采集任务、设备使用、线下服务和保险保障。上述租金优惠就是其中一项,符合条件的用户还可免交押金,但仍需支付租金。
觅蜂科技觅蜂派业务副总裁张智富表示,收取设备使用费,是为了减少设备领走后闲置的情况。后续平台还会根据任务质量和有效率提供设备补贴。
因此,对普通参与者来说,实际能赚多少,取决于接单量、通过审核的有效时长,以及扣除补贴后需要承担的设备租金。
如果采集能在原有的工作和生活中完成,参与者就不必为此单独抽出一段时间。内测用户李国英利用下班时间,在浇花、擦玻璃、整理桌面时完成采集;苏式糕点制作技艺传承人陆小星,则记录揉制、包馅、压模的过程。
“你在正常日常生活或者工作的过程中,顺便把这个东西采了。”姚卯青表示,相比专职雇人采集,这种方式能够降低平台的人力成本。据公司披露,约一个月的内测期间,平台注册用户达到2万人,累计提交采集任务1.3万份。
平台向采集者支付报酬后,这些数据又卖给谁?
姚卯青将客户归纳为三类:希望自建基座模型的具身智能公司、利用无本体数据做预训练的世界模型公司,以及希望提升物理世界决策与规划能力的大模型厂商。
不过,这并不是等用户采完数据,再去寻找买家。按照姚卯青的说法,平台采取“以销定产”的方式,先梳理客户订单,现有库存无法满足的部分,再组织采集。任务被认领完后,就不再开放重复采集;较难进入的场景,则通过额外补贴吸引参与者。在数据定价方面,不同地区存在差异。目前平台已开放40多个城市,根据现场工作人员透露,上海地区的数据采集价格约为30—40元/小时。
因此,用户会做什么,并不直接决定能靠采集赚多少钱,还要看平台是否有相应任务,以及这些任务有多少持续需求。
02 给机器人打基础,能搭起多高的楼?
在整个具身数据中,分为五层,从下到上分别为:通用图文视频、仿真数据、Ego数据、UMI数据和真机数据。越往塔尖,数据越直接对应机器人动作,但采集成本高、规模难扩大;往塔底,数据越容易大量获取,但转化成机器人能执行的动作,需要更多适配。
类似觅蜂这样的数据采集方式,在整个具身数据采集模块属于Ego Data(第一人称视角数据),它的主要作用在具身模型的预训练环节。
(具身数据金字塔,来源:Data Pyramid for Embodied Manipulation: A Survey)姚卯青表示,Ego数据主要用于大模型和世界模型的早期预训练,提升零样本泛化能力,而非优化单个任务。其价值在小规模时往往不明显,规模扩大后才可能逐步显现。
那么,在当前行业越来越重视应用落地的背景下,市场对于大规模Ego数据的需求,究竟能否转化为可验证的模型能力提升?
一位机器人领域从业者告诉腾讯科技,具身模型“大脑”预训练阶段的数据采集需求依旧存在,但数据价值并不只取决于规模,还取决于采集的精细程度。
关于其所能产生的实际用处,以Figure近期公布的Helix 2.5成果为例:模型首先使用Index采集的人类行为数据进行预训练,再针对“整理客厅、叠毛巾、铺床”三个具体行为进行任务适配,最后进入30个此前未见过的家庭环境进行测试。根据Figure官方披露,经过Index预训练后,模型的零样本成功率从9%提升至56%。
这说明,Ego数据的价值不仅在于帮助机器人完成某个固定任务,也可能体现在提升模型对陌生环境和新物体的泛化能力。

但这并不意味着每家公司都需要重新训练一个新的具身基座模型。一些业内人士认为,Physical Intelligence已经提供了较成熟的预训练基础,许多具身模型算法可以直接在此基础上进行适配。与此同时,前不久,Robocurve对接入GPT-6 Astra的机械臂测试显示,通用模型接入机器人控制系统后,也能在“方块入碗”任务中取得95%的完成率。虽然这属于部署阶段的控制测试,并不能等同于具身预训练,但它至少说明,模型层正在快速成熟。
一位业内人士直言,未来OpenAI等拥有强大算力和通用模型能力的企业进入具身智能领域后,可能对部分具身基座模型形成“降维打击”。
在这一背景下,Ego数据的产业价值可能不再只是帮助企业从头训练新的基座模型,而是为已有模型持续补充真实场景、长尾任务和跨环境经验,进一步降低模型适配成本,提升其在现实世界中的泛化能力。
相比较于预训练,不少具身模型算法人员更关心的,是如何降低真机数据训练成本。一位具身模型企业的工作人员告诉腾讯科技,“降低真机数据训练成本,是我们迫切希望能被解决的问题”。该公司的业务目前主要是为客户定制场景方案,帮助机器人完成特定任务。他表示,如果客户需求紧迫、对完成效果要求较高,直接使用真机数据训练通常能取得更好的效果;但由于真机数据成本较高,实际训练中也会搭配Ego数据和仿真数据,以降低成本,但这又会拉长交付时间。
03 结语
普通人的日常技能,正被机器人“盯上”。
叠衣服、做饭、整理房间、配送货物,这些曾经无人关注的生活动作,如今都可能成为训练机器人的数据。觅蜂派并不是唯一入场者,Figure、DoorDash、micro1 Robotics、Sunday Robotics等海外公司也在招募普通人,有偿采集家务、配送、维修等真实操作。
可见,数据采集,正从实验室里的专业项目,变成一门面向普通人的新生意。
不过,行业现在更关心的,已经不只是如何让模型“多见世面”,而是如何尽快把它训练成能够真正干活的机器人。对于预训练数据,市场也需要进一步验证:这些通用经验究竟能在多大程度上转化为真实任务中的成功率提升,并减少后训练所需的真机数据。
这也决定了,普通人的每一个动作,最终能否真正变成机器人的生产力。







