Token导航 LogoToken导航

德塔智能谈双足人形机器人落地与2027年能力拐点

更新时间 2026-10-08来源 腾讯财经正文 5642字阅读约 18分钟3 张图片

文|杨心玥

编辑|刘鹏

走进德塔智能这家公司,最先映入眼帘的,是一个个摆放在中央区域的双足人形机器人。

它们大小不一,或蹲在工位旁,或立在拐角。办公区一隅被布置成家的模样——沙发、暖灯、木色餐桌。四五位员工头戴D1设备,在这里推门、开灯、坐下站起。看起来稀松平常的动作,正被采集,变成具身智能理解世界的语言。

具身智能一直是资本市场上性感的叙事线,它承接了大模型的扩张想象,又试图把智能从语言和屏幕带进物理世界。早在八十年代,机器人学家就已提出“莫拉维克悖论”:一个三岁小孩无需思考就能完成的感知与运动,机器却举步维艰。直到今天,产业仍缺少一套能把想象力落地的叙事坐标。

“人类80%的神经元都在小脑,但此前具身智能,都没有把它好好用起来。”德塔智能首席科学家黄思远说。这正是9月28日发布的新模型Delta-0,试图回答的问题。

从德塔智能向西几公里,就是清华园。马晓健和黄思远从这里出发,后来先后赴美国加州大学洛杉矶分校(UCLA)攻读博士,也在那里遇见了第三位创始人刘航欣。几年后,三人陆续回到北京通用人工智能研究院,并在2026年共同创办德塔智能。

过去8个月,这家公司已完成六轮融资,累计金额超过5亿元,投资方既包括高瓴创投、元禾控股、复星锐正、华映资本、联想创投等机构,也出现了乐聚、星海图等头部人形机器人厂商。与此同时,德塔已与乐聚、星海图、宇树等本体厂商建立合作,试图从数据采集、基础模型到不同机器人本体的适配,搭起一套完整的技术闭环。

在办公室里,腾讯财经与CEO马晓健和首席科学家黄思远聊起刚刚发布的模型,也探讨行业最关心的几个问题。马晓健判断:具身智能未必需要更大的模型,而需要更多的数据。他认为要获得足够的泛化能力,可能需要5000万小时有效数据;按照今天的采集成本,仅数据投入就可能达到百亿元级别。

图片

“越像人的本体,越容易从人类数据中学习。”马晓健说,市场愿意给具身智能行业这么高的估值和溢价,本质上不是期待机器人最后只能翻快递包裹或者打螺丝,而是希望它成为一种通用形态,最终解决通用 AI 在物理世界中的问题。如果最终目标是这个,那么双足人形机器人是很重要的载体。

新模型Delta-0:具身智能不需要更大模型,而是更多数据

腾讯财经:你们这个模型大概是从什么时候开始训练的?

马晓健:我们大概是从4月份开始做。最开始两个月主要在做前期准备,真正开始训练大概是在6月底。

腾讯财经:新模型的参数规模有多大?

马晓健:在7B以下。具身智能需要的未必是更大的模型,而是更多的数据。比如让机器人做一道菜,“先做什么、后做什么”可以由大语言模型规划,我们解决的是机器人“具体怎么做”。

具身智能真正困难的不只是扩大模型参数,而是让大小脑协同,并从足够多的真实数据中学习。我认为这可能也是物理AI与数字AI的重要区别:数字AI更依赖大模型,物理AI可能更依赖海量数据,模型本身未必需要那么大。

图片

腾讯财经:这次的模型主要强调“人形智能”。能不能具体解释一下,“人形智能”解决了哪一层的问题?相比行业里通常讲的 VLA 或其他基础模型,有什么不同?

马晓健:我们主要解决了三个问题。第一,是让“大脑”学习人如何使用全身与环境交互。过去行业更多训练机器人使用上肢,而我们的任务涉及蹲、拉、核心发力等全身动作。因此,我们通过人类全身数据训练,让“大脑”学习人如何调动全身完成任务。

第二,是解决“大脑”和“小脑”两个系统如何协调、配合和联合训练。“大脑”对应的是任务智能,“小脑”对应的是运动本能。它们本质上是两个独立系统,而且运行频率也不一样。我们为此设计了一个信息交互的中间界面。

比如,如果让“大脑”直接控制每个关节,就像让人走路时先计算膝盖该转几度、脚踝该转几度,太复杂。更自然的方式是让“大脑”只决定“手往哪儿、脚怎么迈”,再由“小脑”把它翻译成具体关节动作。

第三个问题,是实现机器人对力和位置的复合控制。双足机器人不仅要知道手脚应该移动到哪里,还要知道应该使用多大的力。我们在不依赖昂贵力控设备的情况下,通过位控实现力和位置的混合感知与控制,从而提高全身操作的稳定性。

腾讯财经:这套模型能否直接迁移到不同机器人本体?更换本体后需要重新训练吗?

马晓健:我们有“大脑”和“小脑”两个模型。“大脑”可以跨本体,因为它控制的是一个抽象的人体表示,先决定人的手、脚和身体怎么运动,再将动作映射到不同机器人。

“小脑”则与具体本体相关。不同机器人的电机性能、关节力矩等存在差异,因此更换本体后需要对“小脑”进行后训练,但适配速度可以比较快。

腾讯财经:你们为什么专门做了一套采集数据的头戴设备D1,当时你们发现行业的数据采集缺了什么?

马晓健:因为人形机器人有腿。如果像现在很多方案一样只采集人的上肢,那么这些数据永远无法真正提供“边移动、边操作”的能力。

从技术任务来看,机器人可以大致分为几个方向:Locomotion(移动与运动能力),比如跑步、跳舞;Manipulation(操作能力),比如抓取、开门;再进一步是 Locomotion + Manipulation(移动与操作协同),也就是一边移动、一边完成操作。我们做的实际上是第三类。它不仅包含前两类能力,还能够解锁新的任务,比如爬梯子。

腾讯财经:头戴设备把人类数据转化给机器人,让机器人学习人的操作,中间最难解决的问题是什么?

黄思远:最难的是缩小人和机器人之间的数据鸿沟。不同的硬件、模型和数据形态,本质上都在解决这个问题。我们需要建立一套完整的数据管线,包括数据采集、清洗、去噪,以及将人类数据映射到与机器人尺寸、形态相匹配的表示,让机器人真正“吃进去”这些数据,用于预训练和后训练。

现阶段,我们首先要建立原生的人形机器人基础模型,让它充分利用人类和机器人数据,提高操作的拟人性和流畅度。下一步,当机器人进入不同场景部署后,再把人类反馈、人工干预和垂直场景数据持续纳入训练,形成数据闭环。我们目前要解决的,就是尽可能提高数据质量、缩小人机 Gap,让模型更充分地利用人类数据。

腾讯财经:目前具身智能行业一直在说“缺数据”,背后的问题是什么?

马晓健:现在不是缺某一种数据,而是整体数据量远远不够,而且比较零散。

如果要实现具身智能的“预训练”,让模型面对不同场景和任务时具备一定的泛化能力,按照目前对Scaling Law(规模定律)的估算,可能需要约5000万小时的有效数据。考虑到清洗损耗,原始采集量甚至要达到1亿—2亿小时。

按目前的采集、标注和清洗成本计算,每小时可能需要100—150元,仅数据投入就可能达到百亿元级别,这不是任何一家机器人公司能够独立承担的。

因此,未来更可能由不同机构共同采集,逐渐形成足够大的数据池。这里有两个关键:一是持续投入、生产新的数据;二是避免同一批数据被反复交易和重复计算。

押注双足:人形机器人可能更快落地

腾讯财经:你们为什么从一开始就坚持双足人形路线?你们想解决的是什么问题?

马晓健:今年1月份行情很好的时候,我们跟别人说要做双足人形机器人,很多人不理解。

当时我收到的主要有两种评价。一种是:“为什么要做双足?这个东西有什么用?双足不是只能跳舞吗?”第二种是:“这个东西太难了,你们肯定做不出来。”

过了几个月以后,我们做出了一些东西,大家也逐渐看到了双足机器人的价值,但行业行情又发生了变化。不过我们的心态比较平静。因为我们从十年前就开始做机器人,对机器人有比较原生的认识,也有自己的技术追求。

市场愿意给具身智能行业这么高的估值和溢价,本质上不是期待机器人最后只能翻快递包裹或者打螺丝,而是希望它成为一种通用形态,最终解决通用 AI 在物理世界中的问题。我们判断,如果最终目标是这个,那么人形机器人是很重要的载体。

图片

腾讯财经:为什么你们认为双足机器人更具优势?

马晓健:具身智能行业有一个比较重要的共识,就是人类数据非常重要。我们的判断是:越像人的本体,越容易从人类数据中学习。

2025年的时候,我们只有几百小时的数据,就已经能够让宇树机器人实现跳舞。现在我们大概约十万小时的数据,已经能够出现一些初步的全身协调能力。

我个人认为,双足人形机器人的落地速度甚至可能比轮式机器人更快。这个观点比较反常识,因为很多人觉得双足人形机器人目前只能跳舞,很难落地。双足人形机器人能够解决的很多场景是真正的刚需场景,而一些轮式机器人解决的问题,客户的付费意愿反而没有那么强。

井下、海上、野外这类刚需巡检场景,对机器人的下肢通过能力和上肢操作能力都有很强的要求。机器人需要爬梯子、爬楼梯、通过复杂地形,同时还要能够使用上肢操作设备。这些事情轮式机器人很难完成。

未来可能到 2027、2028 年,随着大家不断采集数据,数据量积累到一定程度以后,会出现一个拐点:双足人形机器人的能力可能开始表现出优势。因为它的身体形态更像人,也能够按照人的方式作业,所以能够更充分地从人类动作中学习。

腾讯财经:目前人形机器人最适合优先落地在哪些具体场景?

马晓健:能源、基建以及高危特种作业,是目前比较明确的方向。

这些场景有一个共同点:人去现场的成本高、风险大,同时客户又有比较强的付费意愿,因为机器人解决的是刚需。

我举两个例子。第一类是工地,包括巡检、设备操作和物料搬运。比如桥梁、隧道,以及大型水电工程。这些地方很多场景无人机解决不了,履带式设备通过也很困难,需要四足或者双足机器人,这类兼具地形通过性和上肢操作能力的本体。

第二类是能源场景。比如现在很多风电场建在海上,有配套的升压站,存在大量设备巡检维保的需求。这些场景通常环境恶劣,人工成本和人力作业的风险都很高。比如油田,新疆一些油井之间可能相隔 20 公里,现在可能需要一个人开着车在不同站点之间巡检和操作设备。如果一个油井停机,人开车过去可能就要几个小时,这几个小时都意味着停工。类似的还有地下空间、核反应堆等场景。

腾讯财经:现阶段,人形机器人在真实工业场景中,更现实的部署方式是什么?

马晓健:我们在实际项目中,客户提出过,如果一个人能够同时管理10台机器人,就已经有很大价值。

以倒闸为例,机器人从移动到设备前、开门、伸手,大部分流程都可以自主完成;但最后按下开关这一步,客户反而可能要求人工确认。因为设备价值高,一旦误操作,风险和责任都很大。

所以现阶段更合理的模式,是“绝大部分自主运行 + 关键环节人工接管”。

腾讯财经:你如何理解具身智能真正的“技术突破”?目前距离这个节点还有多远?

马晓健:我认为我们现在还不能称为真正的技术突破,只能说具备了实现突破的必要条件。

我判断真正的突破至少要满足三个标准:第一,在双足人形机器人上具备真正的泛化能力;第二,能够执行长程自主任务;第三,能够适配足够可靠的机器人本体。这三点同时实现,才意味着物理智能进入一个新的技术阶段,后续技术路线也会更加明确。

从全球来看,一些海外公司已经形成了本体、数据和模型的完整闭环,而且持续投入较大,因此有可能更早实现突破。

时间上,我比较乐观,但不认为突破会马上发生。真正意义上的物理智能突破,最快可能也要到明年或后年;如果海外率先突破,国内可能还需要一段时间跟进。

资本继续涌入之后:公司如何构建商业化门槛

腾讯财经:你们目前的商业模式大概是什么?主要收入来自哪些方向?

马晓健:目前一部分收入来自数据采集相关业务,包括全身数据采集设备以及相应的数据能力。

我们在全身数据方面具有一定独特性,因为国内真正能够完整采集人体全身动作、并把它转化为机器人训练数据的方案还比较少。

另一部分是围绕机器人模型和实际项目的合作,包括电力巡检、设备维保以及其他真实场景。我们的思路不是单纯卖一个机器人本体,而是围绕人形机器人的模型、数据以及真实场景能力建立商业模式。

腾讯财经:没有自研机器人本体,会不会影响投资人对你们技术能力的判断?

马晓健:影响不大。我们团队过去有整机和机器人手的研发经验,也一致和一些头部本体和主机厂合作。

所以,本体能力对我们来说不是主要问题。这次Demo想证明的是,我们最终可以把自身能力做成一套可部署的方案,适配不同的机器人本体,而不是绑定某一款机器人。

腾讯财经:资本仍在持续进入具身智能赛道,你认为行业当前最需要解决的问题是什么?

马晓健:我认为资本还会继续支持,但行业有三个问题。

第一,真正的技术投入和突破还不够。有些公司融资后反而不敢投入研发,但硬科技如果没有持续投入,就很难形成真正的技术突破。人形机器人真正关键的节点,不是从“会跳舞”变成更多展示,而是开始具备稳定完成生产任务的能力。

第二,资源过于分散。现在大量公司分别融资,人力、资金和数据被分散到很多团队。但具身智能本身需要巨额、长期投入,尤其数据建设很难由单家公司独立完成。未来行业需要一定程度的协作和整合,提高资源利用效率。

第三,对“落地”的理解还不够清晰。硬科技应该先形成核心技术能力,再验证商业化。如果为了收入、上市等目标过早推动落地,容易让行业误以为技术已经成熟,反而削弱长期研发投入。

所以我认为,具身智能不能在关键技术突破之前过早全部押注商业化。

腾讯财经:模型公司在机器人产业链中的核心价值是什么?

马晓健:模型公司和二次开发公司的核心区别,是模型能否快速适应新任务。如果每增加一个任务,都需要长时间定制,本质上还是二次开发;如果只需要少量数据就能快速适配,甚至做到 Zero-shot(零样本泛化),才真正体现模型能力。

所以,模型公司的核心价值是泛化能力,以及由此带来的低成本、快速任务适配。对机器人本体厂商来说,这类公司也能帮助其拓展应用场景,让本体厂商更专注于硬件,把应用能力交给生态伙伴。

腾讯财经:所以你们和本体厂商之间更像是一种生态合作关系?

马晓健:可以这么理解。对本体厂商来说,一种理想的分工是专注于机器人硬件,把模型开发、应用开发和场景落地交给合作伙伴。这样双方各自发挥优势:本体厂商做好硬件和销售,生态公司负责模型部署和二次开发,最终共同推动机器人进入更多应用场景。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多