“把‘世界模型’四个字遮住,然后具体说,你到底在做什么。”
GPT-6、世界模型、VLA、自进化都在争夺机器人的“大脑”。但一颗真正能干活的大脑,到底靠什么长出来?
世界模型,正在成为具身智能最热的几个词之一。
做视频预测、仿真、机器人动作生成的都在谈世界模型。
另一边,GPT-6直接接上机器人做真机测试,大家开始讨论:
既然语言模型已经拥有很强的推理、记忆和规划能力,它能不能直接接管机器人的“大脑”?
投资人邱谆提了一个判断项目真正“含金量”的简单方法:
“把‘世界模型’四个字遮住,然后具体看,它到底在做什么。”
能不能看懂物理世界、预测一个动作的结果?能不能做决策,并在真机上跑通?第一次失败以后,下一次能不能做得更好?
机器人大脑究竟怎样才算成立?
本期虎嗅AI100闭门会,我们邀请了:
章鱼动力世界模型合伙人 陈文科
华映资本海外合伙人 邱谆
域变换联合创始人、南京大学特聘研究员 吴昊
墨奇智能世界模型负责人、复旦大学可信具身智能研究院助理教授 吴桐
和主持人宋思杭,从模型研发、资本、自进化和学术前沿四个视角展开了一场讨论。
整场下来,有5个判断值得继续追踪:
1. 别只看“世界模型”名字,机器人大脑最终比的是干活能力。
2. GPT-6证明语言智能很强,但物理智能不能只靠语言长出来。
3. 比起Demo,预测、决策、真机闭环,才是大脑的三道真考试。
4. 越接近真实部署,大脑越离不开身体:模型、本体、控制必须协同。
5. 下一家高估值公司,可能来自现有玩家,也可能来自一条新路线。
一、先遮住“世界模型”四个字
讨论一开始,第一个问题就是:世界模型到底是什么?
陈文科给出的定义相对底层。
在他看来,世界模型首先要和“世界”真正发生关系:它需要能够预测未来世界,同时对时间上的因果关系进行推演。
比如:机器人推一个杯子,接下来杯子会往哪里移动;夹爪改变力度之后,物体状态会如何变化。
吴昊进一步把这件事提炼成三个问题:
1、能不能预测未来?
2、预测结果能不能帮助决策?
3、决策最后能不能在真机上闭环?
如果只能生成一段漂亮的视频,却不能帮助机器人做下一步决定;或者模型能输出一个判断,却无法在真实机器上执行和验证,那么至少从具身智能角度,它距离大家真正期待的那颗“大脑”还有很长距离。
而邱谆的视角更加务实:在投资中,他并不太关心一家公司的技术是不是被归类为世界模型。
VLA、预测视频、预测行为、做因果建模都各是一条路线。
在今天行业里有人把世界模型当作技术手段,有人把它直接当作最终目标,语境很容易混淆。
于是他提出:先把“世界模型”四个字遮住。
近十年前看“元宇宙”也是类似逻辑。
一个宏大概念越试图覆盖所有东西,它本身提供的信息反而可能越少。
把这个大词拿掉,看下面究竟是在做 VR、游戏,还是区块链,才真正清楚。
世界模型也是一样。
吴桐从技术上补充,今天具身行业真正讨论的,更多是视觉世界模型,它大致分成两条路:
一类用视频预测动作对世界状态产生的变化、帮助训练和评估机器人的策略;
另一类让视觉预测直接参与动作生成。
但广义上来看,语言模型也可以被认为是一种世界模型。
所以更准确的问题是:世界模型,到底给机器人大脑增加了什么能力,以及一颗机器人大脑到底需要什么?

二、GPT-6很强,但机器人大脑不能只靠语言长出来
GPT-6让这个问题变得更加尖锐。
过去,大语言模型和机器人之间还有一道相对清楚的边界:语言模型负责理解和推理,具身模型负责动作。
但当通用大模型开始直接接入机器人以后,问题出现了:
Language已经这么强了,还需要单独做具身大脑吗?
陈文科的回答,从底层出发:语言到底离Action有多远?
他用三个字母拆机器人大脑:L、V、T。
L是Language,语言;
V是Vision,视觉;
T是Tactile,触觉。
经历过语言模型和视频生成模型的Scaling后,在他看来,GPT-6最重要的意义之一,是再次说明了一件事:
当模型Scale到一定程度,确实可能自然涌现出新的能力。
但这并不等于:Language Scaling可以直接换成Action能力。
(Scaling,指通过扩大模型、数据与计算等规模持续提升能力)
他举例:一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍:“我要把手移动到杯子旁边,再抓住它。”
很多物理动作,本身不以语言作为最直接的中介。
因此,他判断,L更适合理解、规划和长程任务拆解;真正直接连接物理世界和机器人动作的,是V和T。
机器人首先得“看见”。
物体在哪里、姿态如何、动作以后环境发生了什么变化,都需要视觉持续反馈。
但只有视觉不够。抓一个水瓶时,力是不是太小、瓶子是不是正在往下滑、接触面发生了什么变化,这些都和触觉、力反馈有关。
所以真正进入物理世界以后,机器人大脑需要解决的不是一个单纯的“语言推理”问题,而是:
L、V、T最终怎样共同作用于Action(动作)。
吴桐团队对GPT-6的真机测试,恰好给这个判断提供了另一侧的观察。
在她的体验里,GPT-6确实表现出了一些过去VLA或World Action Model很难获得的能力:
更强的指令泛化、In Context Learning,以及长程任务中的理解和交互。
它可以把一个复杂目标拆成若干步骤,做完一步之后重新观察,再继续判断下一步。
这是GPT-6非常强的地方。
但它的局限也同样明显。
第一是实时性。
云端大模型可以慢慢推理,但机器人在现实中需要快速反应,不可能每执行一步都停下来长时间思考。
第二是视觉反馈仍然不可替代。
吴桐在真机测试中观察到,当摄像头被部分遮挡,相当于把模型的“眼睛”蒙住以后,任务表现会明显下降。
GPT-6能够理解自己想做什么,却不意味着它有一个完整的“动作之后世界会如何变化”的物理模型。
因此,她认为,一个现实方向可能是:
大语言模型承担更高层、更低频的System 2;
VLA或者World Action Model承担更快、更贴近动作执行的System 1。
这也让GPT-6真正带来的变化变得更加清楚。
它推进行业重新回答:
一颗机器人大脑里的理解、规划、视觉、触觉和动作,究竟应该怎样分工。
语言智能可以帮助机器人想明白。
但物理智能最终还得让它看见、感受到,并真正把事情做完。

三、从Demo到部署,“大脑”要自进化,也要数据和Infra
今天判断一个机器人是不是“聪明”,最直观的方法仍然是看Demo。
但最多证明:它在这个环境里,曾经把这件事做成过。
但是在真实环境中,换一张桌子、材质、灯光,甚至本体之后还能不能做,Demo回答不了。
吴桐给出的技术标准很直接:如果是World Action Model(世界动作模型),就要看生成的策略能否在真实环境里稳定、安全、高成功率地运行;如果是世界仿真器,就看它有没有真正让后续的策略训练变得更好。
而吴昊提出真实世界非常长尾和开放,大脑在真实环境中的交互,难以通过单纯的模型预训练来解决。
大脑若想真的走向真实环境中的部署,需要在物理交互中持续进化。
吴昊所在团队做具身自进化,想解决的正是Demo和真实部署之间的断层。
他现场用了一个很直观的假设:
如果一个模型今天只有40分,不一定要把它关在实验室里等到90分再部署。
更理想的状态,是让它进入环境,通过真实交互,从成功和失败中不断学习,让能力继续往上爬。
机器人大脑真正重要的,不只是“出厂时会多少”。
而是:进到真实世界以后,它还能不能继续变强。
陈文科从Scaling角度给出了另一个补充。
在他的观察里,模型规模和数据规模继续提升,确实能够带来动作表现的变化;而且世界预测得越准确,模型输出的动作也可能随之变得更准确。
但Scaling能够成立的前提,是:数据和Infra先做对。
如果训练数据、基础设施都没有准备好,就急着讨论Scaling Law是否存在,本身可能还太早。
所以最终,判断一颗机器人大脑的标准变得更简单:
不是生成得多像。也不是Demo有多炫。
而是模型进入系统以后,机器人有没有真的变得更会干活。

四、越接近真实世界,越没有一颗悬空的“大脑”
当一颗“大脑”开始真正驱动机器人,另一个问题随即出现:它能不能像今天的大模型API一样,完全独立于身体存在?
陈文科的答案很直接:“纯做大脑肯定是不行的。”
原因很简单:同一种机器人,不同批次的硬件会有差异;硬件有寿命;执行器存在误差;视觉有噪声;接触瞬间需要高频反馈;一个真实动作背后,还有运动学、动力学、控制和力反馈。
这些问题不会因为上层模型更加聪明就自动消失。
所以在他看来,如果最终目标是让机器人真正进入生产力系统,大脑和硬件就不能彼此孤立,需要进行Co-Design。
但这也不等于“做大脑就必须从第一天自研全部本体”。
吴桐对此有进一步的保留。
她的判断是:“一个通用大脑可以相对独立,但一个真正好用的机器人仍然需要软硬耦合。”
她举了自己团队的测试。
拿到GPT接口之后,他们先在商业机械臂上尝试,随后把模型部署到自己的本体上。
模型没有见过这款本体自己的训练数据,也能完成导航、握手、举起玩偶等动作。
这说明,一些能力——任务理解、空间认知、行为认知——完全可以跨越本体。
但她也承认:如果目标不是“勉强能做”,而是要让操作足够自然、流畅,真正进入商业场景,那么大脑和硬件之间肯定需要进一步适配。
两种观点的侧重点不同,但共同指向一个现实:
大脑能力能不能跨本体迁移?
可以。
一个商业机器人能不能完全无视本体差异?
很难。
机器人大脑越接近真实世界,讨论就越不像一个纯模型问题。
模型、控制、本体、传感器、数据、Infra重新被绑到了一起。
现实的问题是:谁能把模型能力与真实身体之间的最后一段距离补上。

五、上限可以很高,但具身智能的“AI Coding”还没出现
也正因为如此,具身大脑的估值问题显得有点“抽象”。
一边,是极高的技术难度和尚未完成的真实闭环。
另一边,是资本已经对这颗未来的大脑给予较高想象。
邱谆并不否认这种长期价值。
在他的投资逻辑里,世界模型可以只是具身大脑的一条路线。
真正重要的问题是:未来会不会出现一个类似基础模型的平台级机器人大脑。
如果这个能力真的成立,它的价值上限可以非常高。
邱谆用OpenAI这类基础模型公司的价值逻辑去理解这种长期可能性。
但问题是:现在还不知道谁会做到,甚至不知道最先在哪个场景做到。
他在现场强调一个投资原则:“高认知,低判断。”
做投资需要深入理解前沿技术。但理解得足够深,并不意味着投资人就有能力替科学家判断:
哪一种世界模型定义一定正确;哪条技术路线一定成为终局;或者某个公司未来一定领先。
具身智能仍然处在一个高度不确定的阶段。
最重要的商业问题之一,也没有答案:具身智能的“AI Coding”场景到底是什么?
大语言模型已经逐渐找到Coding这样一个高价值、高频、能够持续吸收模型能力的场景。
但具身智能呢?工厂?物流?家庭?康养?
邱谆的判断是:现在就回答,太早。
他拿大语言模型做类比:即使GPT Moment真正出现以后,行业也花了很长时间,才逐渐看清真正高价值的应用会落在哪里。
而具身智能还没有出现属于自己的涌现时刻。
他也指出:资本周期本身也不会一直向上。当前行业存在过热。
VC会在过热和过冷之间波动。资本集中进入,随后又退出,过程中即便是不错的公司也可能遭遇融资困难,需要穿越周期。
至于未来真正跑出高估值公司的,会不会就是今天已经在牌桌上的玩家,邱谆同样没有下判断。
他拿NLP的发展做类比:行业曾围绕BERT一类路线反复探索,后来又出现了GPT这样的新范式。
具身智能今天的技术路线同样没有完全收敛,未来的突破者可能来自现有公司,也可能来自一家新公司、甚至一条现在还没有成为主流的新路线。
而且,第一个提出新方法的人,也未必是最后真正把它做出来的人。
吴昊对此提供了另一层观察:资本周期和技术进步,其实是两条线。
资本有自己的目标回报率和风险偏好,但技术仍然会继续往前走。
最终真正改变资本判断的是:
把人拉到一个真实现场,让机器人在足够开放的环境里把事情真的做出来。
于是,一个错位出现了:
资本已经开始为通用机器人大脑的终局定价,技术却仍在寻找自己的“Coding”。
而当终局还不清楚时,真正的分歧出现:
今天到底应该先把模型继续做聪明,还是先把它送进真实世界?

六、通往通用的两条路:先把大脑做聪明,还是先把一个场景跑通?
到最后,嘉宾对于“今天应该怎样走向通用”没有相同的答案。
吴昊强调真实环境里的闭环进化。陈文科强调模型能力本身。
一个更接近:Deployment first。另一个更接近:Scaling first。
陈文科的判断来自他过去做大语言模型和视频生成的经验。
技术刚出现时,大家总会急着追问:能不能商业化?能不能先找一个垂类?能不能赶紧产生收入?
但在他的观察里,很多时候真正决定后续应用爆发的,并不是最早找到了一个场景,而是模型的基础能力先跨过了临界点。
早期LLM能力很有限时,商业化空间同样有限;等模型开始拥有更强的Coding、Agent和工具调用能力以后,应用才迅速自然扩展开来。
所以他的优先级是:先继续提高模型“智商”。
吴昊则给出了另一条路径。
他的出发点是:模型不需要等到100分再进入真实世界。
甚至可能恰恰相反。
如果一个模型现在只有40分,可以先把它送进一个相对可控的环境。
让它工作;让人提供必要接管;让它暴露失败;把成功和失败转成新的学习信号;再一点点把40分往60分、80分、90分推。
所以吴昊提出:“先别追求真的把世界模型搞成一个‘世界模型’,你先搞个‘场景模型’。”
物理世界太复杂。
工厂、物流、实验室、家庭,每一个场景都有不同的物体、空间、流程和物理约束。
试图一步理解整个世界,是一个极高的目标。
但机器人真正进入商业环境时,并不需要第一天就拥有完整世界知识。
它可以先进入一个半结构化场景。先把这里的物理规则和因果关系吃透;先真正干一点活;做不到的地方由人接管;运行过程中产生数据,再继续训练和修正;随着模型能力提高,再逐渐减少人工介入。
先人机协同,再逐渐提升自主程度。
在这条路线里,真实场景不只是产品最终落地的地方,也是训练场。
这是“自进化”的核心:机器人不是训练完成以后才进入世界,而是进入世界以后继续训练。
吴昊也强调了这条路线的边界。
在一个工厂跑通,不意味着换一个工厂还能跑——今天行业还没有充分证明真正意义上的跨场景泛化。
所以“场景模型”并不是说通用不重要。
它回答的是:通用还没到的时候,怎么先往前走。
吴桐的判断则提供了第三个坐标。
对她而言,无论采用哪种路线,世界模型首先都是一个工具。
最后真正拿出来工作的,是机器人的执行策略:够不够稳定、快、低成本?任务能不能持续做完?
从这个角度看,扩大模型能力和进入真实场景并不是永远对立的两条路。
真正的问题可能是:通用能力究竟主要从哪里长出来?
是更多预训练、更大的模型、更好的数据和训练基础设施?还是进入现实环境之后,通过失败、反馈和持续交互一点点长出来?今天还没有答案。
但这或许是接下来机器人大脑值得追踪的一场竞争。
结语:模型要变聪明,也要接上真实世界
两个多小时的讨论里,四位嘉宾没有给“机器人大脑”一个统一技术答案。
但把一层层热门名词拆掉以后,一套更具体的判断尺度开始出现:
比起叫什么,更要看它增加了什么能力。
语言推理再强,干活也需要真正连接视觉、触觉和动作。
Demo只是起点,要看预测能进入决策、决策能在真机上闭环。
至于通往通用的路,现在不存在唯一答案。
也许需要把模型继续Scale到一个新的智能临界点。
也许需要更早进入工厂、物流、实验室这些真实环境,让机器人从一次次成功和失败中继续学习。
更可能的情况是:这两件事最终需要同时发生。
模型能力决定机器人能走多远;真实世界则不断告诉模型,哪里还不够聪明。
所以,真正的分水岭,也许既不是谁先把模型做得最大,也不是谁先把机器人送进最多场景。
而是谁最早把这两条线真正接起来:一边让大脑持续变聪明,一边让真实世界持续给它反馈。
直到机器人不只是“会做一次”,而是第一次做错以后,下一次真的做得更好。
本场嘉宾:
陈文科|章鱼动力 世界模型合伙人
邱谆|华映资本 海外合伙人
吴昊|域变换 联合创始人、南京大学特聘研究员
吴桐|墨奇智能 世界模型负责人、复旦大学可信具身智能研究院助理教授
主持人:宋思杭|虎嗅科技组 AI 编辑
本文基于2026年9月22日虎嗅AI100第12期闭门会直播,观点来自嘉宾本人发言。

扫码加入虎嗅AI100闭门会社群
参与系列直播
文章标题:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会
文章链接:https://www.huxiu.com/article/4893699.html
阅读原文:具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会_虎嗅网






