Token导航 LogoToken导航TokenDH.com

从大小脑分层到底层基建:深朴智能跑出闭环加速度

更新时间 2026-09-21来源 创业最前线正文 6187字阅读约 20分钟6 张图片

图片

出品 | 创业最前线

作者 | 魏帅

编辑 | 冯羽

美编 | 倩倩

审核 | 颂文

8月,北京北人亦创国际会展中心,世界机器人大会。一台名为“小朴”的轮式双臂机器人试图完成一段比抓取纸杯复杂得多的任务:找到脏衣物,放进衣篓,带着它移动到洗衣机旁,打开舱门,把衣物送进去。

每一个动作单独看都不新鲜,困难藏在动作之间——衣服是否真的被抓起,洗衣机门是否完全打开,上一环节留下的物体位置,能否成为下一环节可以接续的起点。

只要任一环节衔接失效,后续所有标准动作都会失去意义。这也是长程任务与剪辑精巧的机器人Demo之间最容易被忽略的距离。

深朴智能选择直面这段距离。

物理世界里的人工智能很难只靠仿真或互联网数据一步到位,它更像自动驾驶:先在边界相对清楚的环境里达到可用,再通过真实运行产生的反馈,逐级提高能力。

也正是基于这一判断,深朴智能没有把家庭当成第一个市场,而是选择先进入酒店、零售和家政等“类家庭场景”。深朴要证明的不只是机器人能否洗完一次衣服,而是同一套能力能否在不同房间、面对不同物品反复运行,且由此产生的价值足以覆盖设备、部署和维护的成本。

这是一个技术问题,也是一道苛刻的商业命题。

1、类家庭到家庭:从一间客房启动闭环

创办深朴智能,多少像是李晓飞把自己经历过的一段产业周期重新走了一遍——只是这一次,曾创业近十年的他,将自动驾驶汽车换成了难度更大的机器人。

李晓飞本科和博士均就读于清华大学汽车工程系,研究智能汽车环境感知与人工智能算法。此后近十年,他亲历了一整个自动驾驶创业浪潮,也经历了机器人产品从研发走向交付的关键阶段。

在他看来,两代技术面对的是同一类困难:算法在实验室里达到新高点,不等于产品已经能进入开放的物理世界。自动驾驶需要车辆持续上路,在真实交通中暴露问题,再让数据、算法、硬件和工程系统共同迭代——具身机器人也很难绕开这条路。

2024年10月,深朴智能成立,定位是AI原生具身智能公司,而非单纯的机器人硬件企业。

这个定位包含一个清楚的取舍:本体是能力的载体,公司真正想建立的,是一套能够理解目标、组合动作、验证结果、处理异常并持续学习的系统。

图片

这从底层逻辑解释了深朴智能为何没有直接冲进家庭。家庭有洗衣、整理、清洁和收纳等直观需求,却也是机器人最不友好的起跑线:房型、家具和生活习惯高度分散,人与宠物带来随机干扰,摄像头牵涉隐私,机械臂近距离工作又放大安全责任。技术尚未跨过门槛,产品更是要承受消费级设备对价格、可靠性和易用性的要求。

联合创始人、技术副总裁李明磊在采访中把这一取舍概括为:“家庭是一个很好的终点,但是家庭不是一个好的起点。”

酒店同样有床、桌子、卫生间和大量柔性物品,机器人需要学习抓、放、擦、整理和开门;但房型、物品摆放和服务流程更标准,人与机器的交互也更可控。

不等待一个无所不能的模型突然出现,而是先找到能力与责任边界相对明确的场景,让机器人开始工作、产生反馈,再扩大任务范围。

场景路线也决定了深朴智能的组队逻辑。让机器人进入真实生活空间,需要三类经验同时存在:理解大模型和多模态系统的“AI原生”人才,做过大规模数据闭环和产品落地的人,以及掌握机器人软硬件全链路的工程人员。三类经验之上,还需要一套让数据、模型、本体与场景真正形成闭环的研发体系。

李明磊,正是这套研发体系的设计者与构建者。他在多模态、大规模数据闭环与产品化上有着深厚积累,加入深朴智能后又将这套方法延伸到机器人全链路,把三类经验组织进同一个闭环。

他是中科大与微软亚洲研究院的联合培养博士,毕业后进入微软云和AI部门任资深研究员,主导多模态图文理解的全栈研发,成果规模化落地于Azure、Office和Windows等产品。

在多模态理解领域深耕多年后,他越来越确信,AI的下一个台阶,是从“看懂世界”走向“在物理世界中做事”。他很早就看好具身智能方向,在深朴智能起步阶段便与创始团队一起梳理技术方向。

让他下定决心的,除了方向,还有人。李明磊回忆,早期团队规模不大,但深入交流后他发现,大家既做过研究,也做过产业,能够“背靠背”做事。更重要的是,团队对长期路线很早就形成了共识:先在酒店等类家庭场景中打磨能力,再逐步走进家庭。而要走通这条路,机器人就不能只完成孤立动作,必须具备长程任务能力和泛化能力,并尽量减少模型与特定本体的绑定。

正式加入后,他既参与制定公司的技术路线,也负责搭建覆盖数据、模型、全身控制与导航、具身操作系统、评测与基础设施的端到端研发体系。“在真实场景中迭代”是他的工作信条,他要做的,是把这句话落到研发体系的每一个环节,让机器人的能力在真实世界中持续进化。

李晓飞从自动驾驶中形成的产业判断,决定了深朴智能走什么路;李明磊的“研究到产品”经验,则决定这条路能走多快。它们指向同一个问题:如何让机器人在真实世界里学到的每一次经验,都变成下一次更可靠的能力。

图片

但从研究突破到客户可用,中间并不是一次模型发布。论文可以用特定任务上的最好结果证明方法有效,展台演示可以展示能力边界,客户现场却要求机器人在反复作业中保持稳定,还要能够从失误中恢复。一个模型即使提高了平均成功率,如果同时增加推理延迟、引入新的失败方式,也未必适合进入交付版本。

这也让“闭环”成为一道组织管理难题。如果研究团队只负责刷新实验指标,交付团队只负责解决眼前的问题,现场就容易积累越来越多临时补丁,却难以形成下一家酒店也能使用的能力。

李明磊介绍,深朴智能让研究模型与商业化模型在同一套真机数据上评测,再由连接研究与产品的团队推动能力转入部署、现场失败返回研发。这套机制的意义,是让双方围绕同一批问题判断:新模型究竟解决了什么,是否损害已有能力,以及改进能否迁移到更多任务。

真正考验管理的,是如何协调两种不同节奏:研究需要不断试错,客户需要一个稳定的版本。新能力不能未经验证就进入现场,交付中暴露的问题也不能只靠工程师逐个兜底。

深朴智能能否把两者接起来,最终要看每次模型更新是否减少了现场接管,每次现场排障是否降低了下一次部署的难度。否则,数据即使持续回流,研发与交付仍可能只是两条各自忙碌的流水线。

深朴智能选定了要进入的房间,也组建了让机器人走进去的团队。但房间不会按照研发计划布置:衣物可能从夹爪滑落,舱门可能只开到一半。下一步该继续、重试,还是请人接管?

技术闭环,最终要从这些具体而琐碎的判断开始。

2、闭环加速度:比模型领先更重要的事

李明磊不愿意只用机器人会做多少种“任务”来衡量能力的高低。

取衣、开门、放衣、导航,看起来是四个动作,连在一起却成了另一道题:机器人怎样知道衣服已经拿稳、门确实打开,下一步的前提是否还成立?这正是整个具身智能行业普遍面临的长程任务难题。

深朴智能是国内较早将大小脑分层构建的团队之一,搭建了记忆增强的智能体系统,但起初仍把较多精力放在单个操作模型上。李明磊回忆,单项测试的表现不断提高,组合起来却仍然出错。问题出在子任务之间的“交接棒”:有时机器人以为上一步已经完成,实际并没有;有时操作确实完成了,留下的物体位置和环境状态却不符合下一步的要求。

团队由此意识到,长程任务不能只靠更强的单点能力。系统必须检查动作结果、处理步骤衔接:抓取失败后是否重试,门只开了一半时是否继续,要根据现场状态实时判断,而不是按预设动作执行到底。

基于此,深朴智能把技术框架收敛成“1+2+N”。“1”是一套具身系统,包括负责理解目标、规划步骤并记住进度的智能体,负责抓取、放置等动作的基础操作模型,以及控制与导航模块;“2”是两条数据线路,一条是不占用机器人的无本体采集,解决规模问题,另一条是机器人进入现场后回收的失败与接管数据,处理真实世界不按训练样本行事的部分;“N”是逐步进入的真实场景。“不同场景可能需要不同本体,同一场景的本体也会迭代;模型若过度绑定某一种机器,场景就难以真正扩张。”李明磊说。

图片

但在他看来,“1+2+N”只是框架的外形,真正让它运转起来的,是一个完整的闭环:数据训练模型,模型驱动本体,本体进入场景,场景中暴露的失败再变成新的数据。闭环之下,是一层不常被外界看到的基础设施,包括数据基建、训练基建、运行时基建和评测基建,分别决定数据怎么产、模型怎么训、机器人怎么稳定运行并回传信息,以及每一次修改是否真正有效。

“闭环是具身智能走向真实世界的必经之路,但有闭环只是起点。”李明磊说,“真正形成壁垒的,是闭环的加速度:每转一圈,下一圈都能转得更快、代价更低。”

模型领先几个点,很快可能被追平;难以复制的,是闭环越转越快的能力:发现问题到重新部署的周期越来越短,进入新场景、适配新本体所需的数据和人力越来越少。而决定加速度的,正是底下那四层基建。

这个判断,首先在数据这一环接受了检验。

语言模型可以从海量互联网文本中学习,机器人却很难获得同样充足、可直接用于操作训练的数据。“行业并不是完全没有数据,真正短缺的是能够规模化采集、又足够高保真的动作数据。”李明磊表示。真机遥操作贴近机器人的执行方式,但成本高、难以规模化;无本体采集更易扩展,却往往难以准确还原动作轨迹及其与画面的对应关系。

起初,团队并不想自己做采集系统,毕竟硬件、算法和数据管线都要从头搭建。但试用多种业内设备后,采集的数据在精度和同步上都难以满足直接部署的要求。去年,参加李飞飞团队发起的NeurIPS 2025 BEHAVIOR-1K挑战赛,处理长程家庭任务时更是深有体会:继续提升的瓶颈不只在模型架构,更在数据的质量与规模。深朴由此下决心自己补上这一环。

今年7月底,深朴智能发布高保真无本体数据生产引擎HiFi-UMI。采集员戴上头部相机,双手使用带相机的采集夹具直接完成操作,系统同步记录画面、双手轨迹和夹具开合状态,再经过轨迹重建与机器人回放两道校验,筛掉目标机器人无法执行的片段。

图片

团队只用这样生产出的无本体数据完成后训练,再把策略直接部署到真机上。在同一台机器人、同一套评测下,其任务成功率与使用真机遥操作数据训练的基线基本持平。这意味着,机器人学习的数据生产首次在深朴的验证中有望摆脱对本体的依赖:采集不再受限于机器人数量,闭环的第一个环节由此提速。

相关论文一经发布,便登顶Hugging Face Daily Papers日榜;同步开源的2000小时HiFi-UMI-2K数据集引发社区广泛关注,截至2026年9月17日,在Hugging Face与魔搭社区(ModelScope)的累计下载量已超过61万次。

不过,李明磊强调,“零真机”不意味着部署后的持续学习不再需要真机数据。“无本体数据提供学习的基础,现场数据校正它与物理世界之间的偏差,两者并非替代关系。”进入现场后,团队还会以真机强化学习持续打磨策略,让机器人在真实交互中主动积累经验、自我改进。

机器人进入真实环境后,仍会失败、需要接管,而持续学习正从这里展开——每一次接管只是闭环的起点。“团队需要判断,问题出在感知、动作执行,还是对任务进度的误判;再决定补采什么数据、调整哪个环节,并验证修改是否真正有效。”李明磊说,“壁垒不在于记录了多少失败,而在于同类问题是否越来越少、解决得越来越快,以及解决办法能否迁移到其他任务和场景。”

换言之,只有当加速度快过场景扩张的需求,技术闭环才会真正变成商业上的护城河。

这也是技术闭环与商业化发生联系的地方。

“大家是为你的价值买单的。”李明磊如是说。

3、从一次成功,到一门可复制的生意

选择酒店作为切入场景,是深朴智能的战略判断。这一选择有两重意义:酒店既是机器人学习的现场,也必须是愿意付费的市场。这两件事并不天然一致。客户不会因为一次作业为模型贡献了数据,就接受更慢的服务或更高的成本。

深朴想提供的,不止于配送机器人把物品送到房门口,而是进一步参与整理、清洁和衣物送洗。李明磊认为,机器人除了分担劳动,还能让服务更标准、可追溯:杯子是否清洗、某个区域是否完成清洁,作业过程都会留下记录。服务业人员流动频繁、忙闲差异大,稳定可预期的供给本身就有价值。

但这些价值成立的前提,是机器足够可靠。从“有价值”到“有人付费”,中间隔着一张很长的指标表。一类是运行指标:任务成功率多高,速度是否影响客房周转,能连续稳定工作多久,人工接管占多大比例。另一类是成本指标:一台机器的折旧、维护和能耗是多少,一家新酒店需要多少人天完成建图、采集、调试和流程改造。这些指标共同决定,它最终是一台设备、一项服务,还是一个需要工程师长期驻场的项目。

目前,深朴智能已与中旅酒店等多家客户开展合作。李明磊介绍,现阶段合作的重点,是与客户共同探索能力边界、打磨高价值场景、建立行业标杆;方案跑通并能规模化复制后,盈利会水到渠成。

POC(概念验证)承担着双重作用:客户检验机器人是否有用,深朴检验哪些技术能力能够沉淀为产品。双方的判断标准并不相同。对深朴而言,一个任务值得做,既因为它有潜在收入,也因为它能带回数据,让系统学到更通用的能力。对酒店而言,标准更具体:能否分担工序、保证服务质量,使用成本是否划算。

试点的意义,就是让这两套判断在真实作业中碰面。研发团队认为有价值的任务,可能因为速度太慢、接管太多而不值得购买;客户急需的功能,也可能过于依赖定制,难以推广。因此,POC的终点不是“完成过任务”,而是要厘清三件事:机器能独立承担什么,人需要在哪里介入,换一家酒店后既有方案还能保留多少。

对行业现状,李明磊的判断是:人们可能“高估了现有的水位”,却“低估了水位上涨的速度”。

前半句对应今天的交付现实。展台上的一次成功,容易被理解为机器人已经能够上岗,但客户现场要的是重复完成、异常恢复和可承受的使用成本。POC正是把演示中被隐藏的问题重新暴露出来。

后半句指向闭环带来的飞轮效应。基础模型的预训练为机器人提供了强大的初始能力,但真正让能力持续进化的,是部署之后的持续学习迭代。机器人今天做不好一项任务,不意味着下一次仍会以同样的方式失败。

只要现场问题能被准确识别、转成有效数据,再经过训练、评测和部署,解决下一类问题的周期就会缩短。李明磊期待,随着基础能力提升,新任务所需的示范数据会持续下降,最终只需少量示范。这正是闭环加速度在商业场景的体现。

图片

当然,学习速度不会自动变成商业增长速度。李明磊坦言,数据和模型能够快速迭代,本体硬件则需要更长的验证和打磨周期,也依赖成熟稳定的供应链,好在整个行业正在快速成熟。安全验证、现场维护与客户采购,同样有各自的节奏。

因此,衡量“水位”是否真正上涨,不能只看机器人学会了什么,还要看客户承担的看护和部署负担是否在下降。对深朴而言,POC最有说服力的结果不是一段更流畅的视频,而是三点:下一家酒店用得更快,同样的工作需要更少接管,有人愿意持续付费。

李晓飞从自动驾驶带来的产业判断,为深朴划定了“从类家庭场景切入、在真实运行中逐级进化”的路线;李明磊搭建的闭环研发体系,则要让这条路线跑得足够快。两者最终都要在同一个场景中接受检验。只有当学习速度转化为服务的可靠性和交付成本的下降,“水位上涨”才会从研发者的感受,变成客户可以核算的事实。

具身智能走向产业的关键,也正在于此:不只让机器完成一次动作,而是把一个场景中习得的经验,变成更多场景可迁移、可复用、可规模化的通用能力。

*注:文中题图来自深朴智能官方账号。

文章标签大模型机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多