Token导航 LogoToken导航

觅蜂科技姚卯青谈具身数据全链路打法与单环节局限

更新时间 2026-09-29来源 亿欧网正文 3590字阅读约 12分钟4 张图片

图片

9月23日,上海,觅蜂派全球发布会后的采访中,觅蜂科技董事长兼CEO姚卯青用这句话点出了具身数据领域的供需错配。

图片

当天,定位为全品类高质量物理AI数据众包服务的觅蜂派正式发布,携自研MEgo设备、觅蜂派App、MEgo Engine数据引擎和场景数据联盟亮相。

行业正从Demo阶段走向部署前夜,数据瓶颈比算法更致命。

头部客户开口就是千万小时级的需求,但集中式自采受限于设备、人力、场景,小团队搓几台相机连一千小时的交付订单都拿不下。

姚卯青在采访中多次强调全链路交付能力,而觅蜂的选择很明确:以全链路作为众包数采的核心打法,单环节公司则被视为未来行业分工中的补充角色。

具身数据的入场券,得砸几个亿?

做具身数据不是搭个平台就能跑。规模化数采同时考验硬件、运营、场景和算力,姚卯青用“六边形战士”概括这一要求——既要技术领先,又要供应链、生产制造按消费电子以上标准构建,同时重资产投算力、存储,最后还得会运营。他算了一笔账:应对1000万小时级别的数据需求,“是大几个亿的固定资产投入”。几个人融几百万、一千万,想把规模干起来,“不太合适”。

 图片

姚卯青解释了觅蜂选择全链路的原因:头部客户按周级交付、单周5万到10万小时,缺任一环节都难以“交钥匙”式提供带毫米级位姿、亚毫秒同步、自动语义标签的分级数据资产,而不是一堆视频片段。

觅蜂派业务总经理张智富补充了一个执行细节:觅蜂派设备租金39元/天,推广期19元,“目的不是为了收钱,而是领设备有一定门槛”。从领任务、领设备、做任务、选择场景、下发到结算,这套全链路闭环在全球还是第一个。

觅蜂科技副总裁殷哲从场景侧给出了一个判断:场景像页岩油,开采成本比采出来的油还贵。食品厂安全许可、工厂老板放行、海南椰子林进入权限——这些壁垒不是多买几台相机就能破的。觅蜂建场景数据联盟,拉了50多家酒店、餐饮、医疗、制造、物业方入局,本质上是在买“开采权”。

行业普遍认为,当数据需求进入千万小时阶段,全链路平台将吃掉大部分头部订单,小团队甚至难以获得投标资格。

门槛只是入场券,真正的考验在于数据本身。众包模式要成立,首先得回答一个问题:路人拍的东西,模型能吃吗?

姚卯青表示,数据质量不是非黑即白,根据不同下游模型类型或训练阶段,可以利用不同质量等级的数据。

这套叫ManiEval的质检体系,逻辑是分级而不是过滤。五维评估——格式时序、任务完整性、传感器质量、语义准确性、动作可学习性——每条数据打上标签后,按质量匹配不同训练阶段。低质量拿去泛化预训练,高精度留给后训练对齐。严重无效片段过滤,其余分级保留。

执行层面,结算侧自动化一天内初筛,直接切掉手部离屏、相机静止、重复作弊的时长。过了结算环节之后,超过95%的比例能最终被模型用起来。张智富说,这不是人工逐帧审核,是自动化流水线——切离屏、切静止、切作弊,剩下的按语义和质量标签自动分级入库。

隐私合规同样靠自动化解决——端上+云端自动脱敏,无需人工逐帧打码,从源头规避泄露风险。

众包的经济账在于“顺手采”。姚卯青强调,这不是雇人专门去采,而是“你在正常工作生活中顺便采了,赚点补贴”。边际人力成本趋近于零。网约车司机浇花擦玻璃15分钟拿到收益,非遗传承人录一段苏式糕点手法——这些原本就存在的劳动被顺手资本化。

内测阶段2万注册用户、1.3万份任务提交,证明了C端参与的可行性。

具身数据的核心瓶颈不是人,而是场景准入

设备可以量产,C端可以参与,但场景准入仍是众包扩规模的硬约束。殷哲用“页岩油"比喻说明:食品厂、养老院、椰子林等场景的许可与带路成本,往往高于数据采集本身。联盟的广度与进场的深度,将直接影响稀缺技能数据的供给能力。

殷哲抛出的“页岩油”比喻,点出了众包真正的瓶颈:不是人,是场景准入。

你要进食品厂拍产线,得过大老板和安全许可;进养老院拍照护工,得让家属和院长点头;去海南采椰子,得有人带路。

这些“开采成本”远高于数据本身的价值。

姚卯青以叠衣服与修水管、修车、理发、美甲对比,称前者数据已泛滥、后者需逐个“点亮”。其排产逻辑是以销定产,按订单优先级匹配稀缺场景,并用补贴激励难进入场景。

场景数据联盟就是为此而生。据发布会介绍,50余家成员覆盖商超、酒店、餐饮、养护、医疗、制造、物业——东呈、中旅、华驿、陈香贵、浦商、普善、德济、正荣、龙旗、海天瑞声、张江集团等。政府侧也在推,重庆永川的“敲门送岗”案例中,殷哲举例称场景方变成了利益方:厂长增收、居民增收、平台拿到渠道。

张智富提到了一个反向申报机制——未来不是平台单向下发任务,而是“你有什么场景告诉我”。农民伯伯种大麦,平台审核通过后下发采集任务。千人千面匹配职业标签,网约车司机、理发师、修车师傅各归其位。

基于当前行业生态,场景覆盖密度会成为一种核心供给能力,但是否决定最终定价权,仍取决于交付、质量与客户需求匹配。

图片

场景壁垒决定了数据供给的天花板,而行业走到千万小时阶段,分工不可避免。姚卯青说了一段话,值得完整引述:“后面逐步发展会出现一些行业分工,不会说大家都是干整个链条端到端形式。可能有些产品进入量产提供设备,但运营通过其他公司使用他们的设备去完成;最后可能还有一些公司,一些环节是做数据的后处理加工、分发,偏技术型的后端服务。”

觅蜂当前提供MEgo头戴300°全景+腕部特写、觅蜂派App、MEgo Engine、ManiEval及22大类场景等全链路能力。而单环节公司也有生存位,可归纳为三类:设备商专做头戴、腕部相机、UMI、手套,只供硬件不碰场景;运营商有酒店、工厂、社区等渠道,用觅蜂或其他设备组织众包,不做引擎;后处理商专攻原子动作切分、6D位姿重建、分级、语义标签输出。

张智富从平台角度补了一句:觅蜂派是服务平台,完成需求和供给之间的撮合。殷哲从场景方视角给了案例:某快递公司加入联盟后,分拣场景数据优先应用,未来设备卖给同行,成了公司第二曲线。

基于这一逻辑,千万小时阶段全链路平台集中交付;亿小时阶段单环节公司凭细分场景或技术模块嵌入平台生态,不是被淘汰,而是被分工。

数据要卖,先过隐私关

数据进入销售,商业模式才算跑通。众包合规包含脱敏、授权、职业管理与标准共识。张智富介绍了注册授权、端云脱敏及意外险;姚卯青从训练标准角度提出真实场景、毫米级/6D、自动语义标签,不重复同地同任务采集。

数据怎么卖,是商业模式最敏感的一部分。

姚卯青把技术路线和销售逻辑绑在一起讲:无本体(Ego)数据用于大模型、世界模型的预训练阶段,提升基础泛化能力;真机遥操数据用于后训练和对齐。“Ego数据不是为了某个任务Demo定向优化用的。”

客户分三类:具身本体公司做自有模型、世界模型公司做无本体预训练、大模型厂补物理决策多模态。据发布会披露,已供腾讯RoboticsX、蚂蚁灵波。

销售端不打包、不强制配比,按货架SKU管理。张智富用了一个比喻:“我们尽量把面包做到符合大众需求,但过程中我们自己本身还是有个货架概念,有标准SKU。你说我需要更多数据,上十万的,我们也可以做定制化服务。”

就像面包馅料——有人要豆沙,有人要肉馅,不能只卖一种。

一个明显的趋势是,头部客户正从广撒网试几十家数据供应商,转向独家定点单一供应商。姚卯青观察到这一变化:“好的坏的数据缠在一起训出来有毒。”质量稳定性比低价堆量更重要。据公司披露,单次出售已有较好的毛利率,但觅蜂更大的意图在于多次销售——同一份高质量数据,分级后匹配不同客户、不同阶段,形成复用。

数据卖出去了,但规模化之后,合规和标准化是绕不过去的坎。

张智富详细解释了隐私机制:自动脱敏不是员工手动逐帧打码,是端上+云端自动化处理,实名授权、电子签约、分类分级。联合信通院发布《具身智能众包数据发展报告》,把众包数据纳入行业治理框架。同时,首批16位“001号机器人训练师”拿到证书,建立成长路径,并为众包人员购买意外险。

姚卯青从技术层面提出标准共识:场景必须真实丰富、空间精度毫米级、6D位姿、自动语义标签。“不能在同一个地点、同一个工作反复采,这是明显不会被接纳的。”

人-机差异是更深层的命题。人的自由度、力觉、触觉无法完全翻成机器人的电机控制。姚卯青表示,无本体数据主要训练通用表征和环境-动作先验,逆动力学翻译和本体对齐留到后训练。“具身与自动驾驶在场景分散度、室内容错率、大模型应用空间上存在差异,不宜简单类比。”殷哲提到了场景联盟的社会价值:带动社区增收,政府敲门送岗,把数据生产变成一种新就业形态。

结语

2万套MEgo、百万小时无本体数据,只是一个起点。面向亿级小时的需求,差距仍然明显。姚卯青强调全链路是觅蜂的打法,单环节是行业的后路。

这句话的另一层含义是:数据基建时代,没有人能靠单点突破吃下整个市场,但全链路平台的存在,让后来者有了嵌入生态的位置。

具身智能的数据基建,才刚刚开始。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多