Token导航 LogoToken导航

具身智能世界模型为何能跑出比OpenAI更贵的公司

更新时间 2026-09-24来源 虎嗅网正文 6765字阅读约 22分钟6 张图片

GPT-6虽强但不够,机器人大脑需视觉触觉协同与真实环境自进化

“把‘世界模型’四个字遮住,然后具体说,你到底在做什么。”

GPT-6、世界模型、VLA、自进化都在争夺机器人的“大脑”。但一颗真正能干活的大脑,到底靠什么长出来?

世界模型,正在成为具身智能最热的几个词之一。

做视频预测、仿真、机器人动作生成的都在谈世界模型。

另一边,GPT-6直接接上机器人做真机测试,大家开始讨论:

既然语言模型已经拥有很强的推理、记忆和规划能力,它能不能直接接管机器人的“大脑”?

投资人邱谆提了一个判断项目真正“含金量”的简单方法:

“把‘世界模型’四个字遮住,然后具体看,它到底在做什么。”

能不能看懂物理世界、预测一个动作的结果?能不能做决策,并在真机上跑通?第一次失败以后,下一次能不能做得更好?

机器人大脑究竟怎样才算成立?

本期虎嗅AI100闭门会,我们邀请了:

章鱼动力世界模型合伙人 陈文科
华映资本海外合伙人 邱谆
域变换联合创始人、南京大学特聘研究员 吴昊
墨奇智能世界模型负责人、复旦大学可信具身智能研究院助理教授 吴桐

和主持人宋思杭,从模型研发、资本、自进化和学术前沿四个视角展开了一场讨论。

整场下来,有5个判断值得继续追踪:

1. 别只看“世界模型”名字,机器人大脑最终比的是干活能力。

2. GPT-6证明语言智能很强,但物理智能不能只靠语言长出来。

3. 比起Demo,预测、决策、真机闭环,才是大脑的三道真考试。

4. 越接近真实部署,大脑越离不开身体:模型、本体、控制必须协同。

5. 下一家高估值公司,可能来自现有玩家,也可能来自一条新路线。


一、先遮住“世界模型”四个字

讨论一开始,第一个问题就是:世界模型到底是什么?

陈文科给出的定义相对底层。

在他看来,世界模型首先要和“世界”真正发生关系:它需要能够预测未来世界,同时对时间上的因果关系进行推演。

比如:机器人推一个杯子,接下来杯子会往哪里移动;夹爪改变力度之后,物体状态会如何变化。

吴昊进一步把这件事提炼成三个问题:

1、能不能预测未来?

2、预测结果能不能帮助决策?

3、决策最后能不能在真机上闭环?

如果只能生成一段漂亮的视频,却不能帮助机器人做下一步决定;或者模型能输出一个判断,却无法在真实机器上执行和验证,那么至少从具身智能角度,它距离大家真正期待的那颗“大脑”还有很长距离。

而邱谆的视角更加务实:在投资中,他并不太关心一家公司的技术是不是被归类为世界模型。

VLA、预测视频、预测行为、做因果建模都各是一条路线。

在今天行业里有人把世界模型当作技术手段,有人把它直接当作最终目标,语境很容易混淆。

于是他提出:先把“世界模型”四个字遮住。

近十年前看“元宇宙”也是类似逻辑。

一个宏大概念越试图覆盖所有东西,它本身提供的信息反而可能越少。

把这个大词拿掉,看下面究竟是在做 VR、游戏,还是区块链,才真正清楚。

世界模型也是一样。

吴桐从技术上补充,今天具身行业真正讨论的,更多是视觉世界模型,它大致分成两条路:

  • 一类用视频预测动作对世界状态产生的变化、帮助训练和评估机器人的策略;

  • 另一类让视觉预测直接参与动作生成。

但广义上来看,语言模型也可以被认为是一种世界模型。

所以更准确的问题是:世界模型,到底给机器人大脑增加了什么能力,以及一颗机器人大脑到底需要什么?

二、GPT-6很强,但机器人大脑不能只靠语言长出来

GPT-6让这个问题变得更加尖锐。

过去,大语言模型和机器人之间还有一道相对清楚的边界:语言模型负责理解和推理,具身模型负责动作。

但当通用大模型开始直接接入机器人以后,问题出现了:

Language已经这么强了,还需要单独做具身大脑吗?

陈文科的回答,从底层出发:语言到底离Action有多远?

他用三个字母拆机器人大脑:L、V、T。

L是Language,语言;

V是Vision,视觉;

T是Tactile,触觉。

经历过语言模型和视频生成模型的Scaling后,在他看来,GPT-6最重要的意义之一,是再次说明了一件事:

当模型Scale到一定程度,确实可能自然涌现出新的能力。

但这并不等于:Language Scaling可以直接换成Action能力。

(Scaling,指通过扩大模型、数据与计算等规模持续提升能力)

他举例:一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍:“我要把手移动到杯子旁边,再抓住它。”

很多物理动作,本身不以语言作为最直接的中介。

因此,他判断,L更适合理解、规划和长程任务拆解;真正直接连接物理世界和机器人动作的,是V和T。

机器人首先得“看见”。

物体在哪里、姿态如何、动作以后环境发生了什么变化,都需要视觉持续反馈。

但只有视觉不够。抓一个水瓶时,力是不是太小、瓶子是不是正在往下滑、接触面发生了什么变化,这些都和触觉、力反馈有关。

所以真正进入物理世界以后,机器人大脑需要解决的不是一个单纯的“语言推理”问题,而是:

L、V、T最终怎样共同作用于Action(动作)。

吴桐团队对GPT-6的真机测试,恰好给这个判断提供了另一侧的观察。

在她的体验里,GPT-6确实表现出了一些过去VLA或World Action Model很难获得的能力:

更强的指令泛化、In Context Learning,以及长程任务中的理解和交互。

它可以把一个复杂目标拆成若干步骤,做完一步之后重新观察,再继续判断下一步。

这是GPT-6非常强的地方。

但它的局限也同样明显。

第一是实时性。

云端大模型可以慢慢推理,但机器人在现实中需要快速反应,不可能每执行一步都停下来长时间思考。

第二是视觉反馈仍然不可替代。

吴桐在真机测试中观察到,当摄像头被部分遮挡,相当于把模型的“眼睛”蒙住以后,任务表现会明显下降。

GPT-6能够理解自己想做什么,却不意味着它有一个完整的“动作之后世界会如何变化”的物理模型。

因此,她认为,一个现实方向可能是:

大语言模型承担更高层、更低频的System 2;

VLA或者World Action Model承担更快、更贴近动作执行的System 1。

这也让GPT-6真正带来的变化变得更加清楚。

它推进行业重新回答:

一颗机器人大脑里的理解、规划、视觉、触觉和动作,究竟应该怎样分工。

语言智能可以帮助机器人想明白。

但物理智能最终还得让它看见、感受到,并真正把事情做完。

三、从Demo到部署,“大脑”要自进化,也要数据和Infra

今天判断一个机器人是不是“聪明”,最直观的方法仍然是看Demo。

但最多证明:它在这个环境里,曾经把这件事做成过。

但是在真实环境中,换一张桌子、材质、灯光,甚至本体之后还能不能做,Demo回答不了。

吴桐给出的技术标准很直接:如果是World Action Model(世界动作模型),就要看生成的策略能否在真实环境里稳定、安全、高成功率地运行;如果是世界仿真器,就看它有没有真正让后续的策略训练变得更好。

而吴昊提出真实世界非常长尾和开放,大脑在真实环境中的交互,难以通过单纯的模型预训练来解决。

大脑若想真的走向真实环境中的部署,需要在物理交互中持续进化。

吴昊所在团队做具身自进化,想解决的正是Demo和真实部署之间的断层。

他现场用了一个很直观的假设:

如果一个模型今天只有40分,不一定要把它关在实验室里等到90分再部署。

更理想的状态,是让它进入环境,通过真实交互,从成功和失败中不断学习,让能力继续往上爬。

机器人大脑真正重要的,不只是“出厂时会多少”。

而是:进到真实世界以后,它还能不能继续变强。

陈文科从Scaling角度给出了另一个补充。

在他的观察里,模型规模和数据规模继续提升,确实能够带来动作表现的变化;而且世界预测得越准确,模型输出的动作也可能随之变得更准确。

但Scaling能够成立的前提,是:数据和Infra先做对。

如果训练数据、基础设施都没有准备好,就急着讨论Scaling Law是否存在,本身可能还太早。

所以最终,判断一颗机器人大脑的标准变得更简单:

不是生成得多像。也不是Demo有多炫。

而是模型进入系统以后,机器人有没有真的变得更会干活。


四、越接近真实世界,越没有一颗悬空的“大脑”

当一颗“大脑”开始真正驱动机器人,另一个问题随即出现:它能不能像今天的大模型API一样,完全独立于身体存在?

陈文科的答案很直接:“纯做大脑肯定是不行的。”

原因很简单:同一种机器人,不同批次的硬件会有差异;硬件有寿命;执行器存在误差;视觉有噪声;接触瞬间需要高频反馈;一个真实动作背后,还有运动学、动力学、控制和力反馈。

这些问题不会因为上层模型更加聪明就自动消失。

所以在他看来,如果最终目标是让机器人真正进入生产力系统,大脑和硬件就不能彼此孤立,需要进行Co-Design。

但这也不等于“做大脑就必须从第一天自研全部本体”。

吴桐对此有进一步的保留。

她的判断是:“一个通用大脑可以相对独立,但一个真正好用的机器人仍然需要软硬耦合。”

她举了自己团队的测试。

拿到GPT接口之后,他们先在商业机械臂上尝试,随后把模型部署到自己的本体上。

模型没有见过这款本体自己的训练数据,也能完成导航、握手、举起玩偶等动作。

这说明,一些能力——任务理解、空间认知、行为认知——完全可以跨越本体。

但她也承认:如果目标不是“勉强能做”,而是要让操作足够自然、流畅,真正进入商业场景,那么大脑和硬件之间肯定需要进一步适配。

两种观点的侧重点不同,但共同指向一个现实:

大脑能力能不能跨本体迁移?

可以。

一个商业机器人能不能完全无视本体差异?

很难。

机器人大脑越接近真实世界,讨论就越不像一个纯模型问题。

模型、控制、本体、传感器、数据、Infra重新被绑到了一起。

现实的问题是:谁能把模型能力与真实身体之间的最后一段距离补上。

五、上限可以很高,但具身智能的“AI Coding”还没出现

也正因为如此,具身大脑的估值问题显得有点“抽象”。

一边,是极高的技术难度和尚未完成的真实闭环。

另一边,是资本已经对这颗未来的大脑给予较高想象。

邱谆并不否认这种长期价值。

在他的投资逻辑里,世界模型可以只是具身大脑的一条路线。

真正重要的问题是:未来会不会出现一个类似基础模型的平台级机器人大脑。

如果这个能力真的成立,它的价值上限可以非常高。

邱谆用OpenAI这类基础模型公司的价值逻辑去理解这种长期可能性。

但问题是:现在还不知道谁会做到,甚至不知道最先在哪个场景做到。

他在现场强调一个投资原则:“高认知,低判断。”

做投资需要深入理解前沿技术。但理解得足够深,并不意味着投资人就有能力替科学家判断:

哪一种世界模型定义一定正确;哪条技术路线一定成为终局;或者某个公司未来一定领先。

具身智能仍然处在一个高度不确定的阶段。

最重要的商业问题之一,也没有答案:具身智能的“AI Coding”场景到底是什么?

大语言模型已经逐渐找到Coding这样一个高价值、高频、能够持续吸收模型能力的场景。

但具身智能呢?工厂?物流?家庭?康养?

邱谆的判断是:现在就回答,太早。

他拿大语言模型做类比:即使GPT Moment真正出现以后,行业也花了很长时间,才逐渐看清真正高价值的应用会落在哪里。

而具身智能还没有出现属于自己的涌现时刻。

他也指出:资本周期本身也不会一直向上。当前行业存在过热。

VC会在过热和过冷之间波动。资本集中进入,随后又退出,过程中即便是不错的公司也可能遭遇融资困难,需要穿越周期。

至于未来真正跑出高估值公司的,会不会就是今天已经在牌桌上的玩家,邱谆同样没有下判断。

他拿NLP的发展做类比:行业曾围绕BERT一类路线反复探索,后来又出现了GPT这样的新范式。

具身智能今天的技术路线同样没有完全收敛,未来的突破者可能来自现有公司,也可能来自一家新公司、甚至一条现在还没有成为主流的新路线。

而且,第一个提出新方法的人,也未必是最后真正把它做出来的人。

吴昊对此提供了另一层观察:资本周期和技术进步,其实是两条线。

资本有自己的目标回报率和风险偏好,但技术仍然会继续往前走。

最终真正改变资本判断的是:

把人拉到一个真实现场,让机器人在足够开放的环境里把事情真的做出来。

于是,一个错位出现了:

资本已经开始为通用机器人大脑的终局定价,技术却仍在寻找自己的“Coding”。

而当终局还不清楚时,真正的分歧出现:

今天到底应该先把模型继续做聪明,还是先把它送进真实世界?

六、通往通用的两条路:先把大脑做聪明,还是先把一个场景跑通?

到最后,嘉宾对于“今天应该怎样走向通用”没有相同的答案。

吴昊强调真实环境里的闭环进化。陈文科强调模型能力本身。

一个更接近:Deployment first。另一个更接近:Scaling first。

陈文科的判断来自他过去做大语言模型和视频生成的经验。

技术刚出现时,大家总会急着追问:能不能商业化?能不能先找一个垂类?能不能赶紧产生收入?

但在他的观察里,很多时候真正决定后续应用爆发的,并不是最早找到了一个场景,而是模型的基础能力先跨过了临界点。

早期LLM能力很有限时,商业化空间同样有限;等模型开始拥有更强的Coding、Agent和工具调用能力以后,应用才迅速自然扩展开来。

所以他的优先级是:先继续提高模型“智商”。

吴昊则给出了另一条路径。

他的出发点是:模型不需要等到100分再进入真实世界。

甚至可能恰恰相反。

如果一个模型现在只有40分,可以先把它送进一个相对可控的环境。

让它工作;让人提供必要接管;让它暴露失败;把成功和失败转成新的学习信号;再一点点把40分往60分、80分、90分推。

所以吴昊提出:“先别追求真的把世界模型搞成一个‘世界模型’,你先搞个‘场景模型’。”

物理世界太复杂。

工厂、物流、实验室、家庭,每一个场景都有不同的物体、空间、流程和物理约束。

试图一步理解整个世界,是一个极高的目标。

但机器人真正进入商业环境时,并不需要第一天就拥有完整世界知识。

它可以先进入一个半结构化场景。先把这里的物理规则和因果关系吃透;先真正干一点活;做不到的地方由人接管;运行过程中产生数据,再继续训练和修正;随着模型能力提高,再逐渐减少人工介入。

先人机协同,再逐渐提升自主程度。

在这条路线里,真实场景不只是产品最终落地的地方,也是训练场。

这是“自进化”的核心:机器人不是训练完成以后才进入世界,而是进入世界以后继续训练。

吴昊也强调了这条路线的边界。

在一个工厂跑通,不意味着换一个工厂还能跑——今天行业还没有充分证明真正意义上的跨场景泛化。

所以“场景模型”并不是说通用不重要。

它回答的是:通用还没到的时候,怎么先往前走。

吴桐的判断则提供了第三个坐标。

对她而言,无论采用哪种路线,世界模型首先都是一个工具。

最后真正拿出来工作的,是机器人的执行策略:够不够稳定、快、低成本?任务能不能持续做完?

从这个角度看,扩大模型能力和进入真实场景并不是永远对立的两条路。

真正的问题可能是:通用能力究竟主要从哪里长出来?

是更多预训练、更大的模型、更好的数据和训练基础设施?还是进入现实环境之后,通过失败、反馈和持续交互一点点长出来?今天还没有答案。

但这或许是接下来机器人大脑值得追踪的一场竞争。

结语:模型要变聪明,也要接上真实世界

两个多小时的讨论里,四位嘉宾没有给“机器人大脑”一个统一技术答案。

但把一层层热门名词拆掉以后,一套更具体的判断尺度开始出现:

  • 比起叫什么,更要看它增加了什么能力。

  • 语言推理再强,干活也需要真正连接视觉、触觉和动作。

  • Demo只是起点,要看预测能进入决策、决策能在真机上闭环。

至于通往通用的路,现在不存在唯一答案。

也许需要把模型继续Scale到一个新的智能临界点。

也许需要更早进入工厂、物流、实验室这些真实环境,让机器人从一次次成功和失败中继续学习。

更可能的情况是:这两件事最终需要同时发生。

模型能力决定机器人能走多远;真实世界则不断告诉模型,哪里还不够聪明。

所以,真正的分水岭,也许既不是谁先把模型做得最大,也不是谁先把机器人送进最多场景。

而是谁最早把这两条线真正接起来:一边让大脑持续变聪明,一边让真实世界持续给它反馈。

直到机器人不只是“会做一次”,而是第一次做错以后,下一次真的做得更好。

本场嘉宾:

陈文科|章鱼动力 世界模型合伙人

邱谆|华映资本 海外合伙人

吴昊|域变换 联合创始人、南京大学特聘研究员

吴桐|墨奇智能 世界模型负责人、复旦大学可信具身智能研究院助理教授

主持人:宋思杭|虎嗅科技组 AI 编辑

本文基于2026年9月22日虎嗅AI100第12期闭门会直播,观点来自嘉宾本人发言。

扫码加入虎嗅AI100闭门会社群

参与系列直播

文章标题:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会

文章链接:https://www.huxiu.com/article/4893699.html

阅读原文:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会_虎嗅网
文章标签OpenAI机器人大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多