
内容|Max
编辑|Max
这个月,我基本是在高强度地用 GPT-6 Astra。
我让它操作软件、写东西、跑长任务,也专门接上 Hyper3D,丢给它一个我自己完全不会做的 3D 项目,看它能不能从一句很模糊的需求开始,自己找工具、做模型、拆部件、写网页,最后把东西真正交出来。

测到后面,我越来越有一个很强烈的感觉:
如果我们过去说的 AGI,是一种能够理解目标、调用工具,并且越来越独立地把工作做完的通用智能,那 GPT-6 可能已经踩进去了。
而我第一次产生这个感觉,其实是因为前两天刷到的一个帖子。
一个叫 Viper 的 Blender 艺术家,转发了 Duncan Trussell 用 GPT-6 Astra 做的一段演示。
Duncan 让 Astra 直接操作 Blender,做了一个完整的 Backrooms 场景。

里面不只是搭几个方块。
建模、灯光、VHS 质感,甚至声音都做了。
Duncan 自己说,整个过程大概用了 5 个 prompt,制作花了 30 分钟左右,最后又用了 20 分钟导出。
然后 Viper 看到了。
他原本一直觉得,自己这些年积累下来的 Blender 技能和艺术感觉,是机器很难替代的一层东西。
结果现在,他看着 Astra 在自己最熟悉的软件里,做出了一个自己可能要花几天完成的场景。
他的第一反应不是兴奋,而是愤怒。
他直接破防了,表示:这他妈像个恶作剧。

我其实很能理解这种感觉。
这几年大家已经看过太多 AI Demo 了。
生成图片、视频、代码,隔一阵就会出现一个看起来很吓人的新东西。
看多了以后,人其实会慢慢脱敏。
但这个 Demo 有一点不一样。
Astra 没有在聊天框里告诉一个 Blender 艺术家你应该怎么做,也不是生成一张看起来像 3D 的图片。
它真的打开了 Blender,进入那个艺术家每天工作的环境,然后开始干活。
看到这里,我第一次有一种很具体的感觉:
AI 已经不再只是坐在 Blender 艺术家旁边回答问题。
它开始坐到他的工位上了。
后来我又去找了很多 GPT-6 的案例。
越看越觉得,Blender 可能只是因为视觉效果最好,所以最容易在社交网络上传播。真正发生的事情,要比 AI 会做 3D 大得多。
比如 OpenAI 拿 Astra 跑过 2023 Microsoft Excel World Championship 的任务。
它不是在聊天框里告诉你 DCF 应该怎么算,也不是生成一段 Python 代码让你自己复制进去。Astra 直接进入 Excel,在人类平时工作的那个界面里完成金融建模。

官方给出的结果是,它完成这些任务的速度大约是当时人类冠军的 4 倍。
这件事听起来没有 Blender 那么震撼,甚至有点枯燥。
但仔细想想,很多工作本来就是这样。
分析数据、调整模型、核对数字、找报表之间的差异,没有任何科幻感,却是很多人每天坐在办公室里花几个小时完成的事情。
GPT-6 开始进入的,恰恰是这些最普通的工作。
再比如音乐。
音乐人 Auggie 只给 GPT-6 Astra 一个要求,让它使用 LilyPond 完成一首巴赫风格的作品。
没有一步一步告诉它旋律怎么写,也没有替它设计后面的结构。

Astra 在 Extra High 模式下持续工作,最后交出来的不是几小节旋律,而是一份完整、可以继续使用的乐谱文件。
真正困难的地方不只是生成几个听起来像巴赫的音符,而是要在更长的过程中保持前后的结构,把主题、声部和和声组织起来,最后交出一个可以真正播放的作品。
这和过去在 ChatGPT 里说一句帮我写首歌,已经不太是一回事了。
模型开始接住的,不只是一个问题,而是一段完整的创作过程。
再往硬件那边看,就更具体了。
一个叫 GoFly 的用户,直接把一块 FPV 无人机飞控板交给了 GPT-6 Astra。
它在 KiCad 里从原理图开始,一路做到六层 PCB,自己完成元器件摆放、布线,再跑 ERC 和 DRC 检查。

最后,它还导出了 Gerber、BOM、贴装坐标这些真正会交给工厂的生产文件。
整个过程跑了三个多小时。
更有意思的是,这个东西没有停留在一张看起来像电路板的图片上。
后来这块板真的通过了嘉立创审核并成功下单。
当然,最终能不能正常点亮还要等实物验证,但它至少已经走到了实际制造流程这一步。
把这三个案例放在一起看,事情就开始变得有点不一样了。
Excel、音乐、PCB,看起来横跨三个完全没有关系的行业,但 GPT-6 做的事情其实很相似:
它不再只是站在一个专业人士旁边告诉他应该怎么做,而是开始进入那些人真正工作的环境,把其中一段工作接过去。
看到这里,我也很想自己试一次。
但我不太想再测一遍 GPT-6 会不会操作 Blender。我更好奇的是另一个问题:
如果一个任务走到某一步,碰到了 GPT-6 自己并不具备的专业能力,它会怎么办?
毕竟一个真正的通用智能,也不可能自己掌握世界上所有专业技能。它会停在那里,还是知道应该去找一个更专业的工具,把任务继续做下去?
我决定挑一个自己也几乎完全不会的领域试试。
我最后选了 3D。
原因很简单,我基本不会。
对 3D 软件的全部印象,大概还停留在高中微机课上摸过几次 C4D,后来基本没再碰过。
现在让我自己从头建一个模型,和零基础没什么区别。
之前我倒是用过 Hyper3D Rodin 做过几个模型,甚至拿生成出来的东西去做过 3D 打印,所以至少知道最后应该得到一个什么样的东西。
这反而很适合拿来做实验。
我不需要判断 GPT-6 的建模手法专不专业,也不打算一步一步教它应该怎么做。
我只想给它一个最后的目标,看看它能不能自己把中间缺的能力补起来。
所以这次我干脆把要求压到最简单,像一个真的什么都不懂的小白一样,只告诉 GPT-6 我最后想要什么。
我给它的原话是:
帮我做一个可以拆开维修的火星探测车 3D 网页吧。
我不懂 3D,具体怎么设计、怎么拆、网页怎么玩你自己想,3D 模型用 Hyper3D MCP 来做,最后给我一个真的能玩的成品。

开始之前只需要做一件事,就是把 Hyper3D 接进 Codex。
这个过程比我想象得简单,在 Hyper3D 官网点开 MCP,把官方给的一段配置提示词直接丢给 Codex,它会自己完成配置,然后拉起浏览器做一次 OAuth 授权。

接好以后,我就基本不管了。
这也是这次测试里我刻意保留的部分。
我没有告诉它火星车应该长什么样,没有规定要拆成几个零件,也没有设计什么维修玩法。
甚至连网页最后应该做成什么样,我都没给参考。
这些东西全让它自己补。
GPT-6 接到任务以后,先判断自己需要一套真正能放进网页里的 3D 资产,于是调用 Hyper3D Rodin 开始生成火星探测车。
整车模型出来以后,它又继续通过 Hyper3D 做拆件,把原本完整的探测车处理成可以独立操作的模块。
最后它自己整理出了控制与通信舱、太阳能板、四个驱动轮等 7 个模块。

中间它只停下来找了我一次。
因为下一步要把 Hyper3D 生成的真实模型下载下来,真正嵌进网页,工具要求我明确确认下载授权。
GPT-6 自己停下来问了一句,我点了允许,它就继续往下跑了。

真正让我觉得有意思的是后面。
我原本只说了一句做一个可以拆开维修的火星探测车网页,最后它自己把整件事设计成了一个叫 ARES 火星维修站 的小游戏。
背景是探测车刚经历了一场沙尘暴。
进入页面以后,右边直接列出了三项需要处理的任务:恢复通信链路、清理太阳能板、紧固驱动轮。
中间则是 Hyper3D 生成的探测车,可以自由旋转,也可以直接检查不同部件。

它也没有把拆件做成一个单纯好看的爆炸视图。
比如点击右前驱动轮以后,系统会先诊断出轮毂固定件松脱,对应的轮子会被高亮出来,然后要求你真的把这个部件从探测车上拆下来。

拆下来以后,还会进入一个单独的维修台。
GPT-6 自己设计了三种维修工具:除尘刷、力矩扳手和校准仪。
不同的问题要选不同的工具,驱动轮松动要重新紧固,通信异常要做信号校准,太阳能板积灰则要一点点清理。

修好之后,再把零件装回探测车,系统重新检查状态。
三个问题全部处理完以后,任务才算结束。

我把最后这个可以直接玩的网页链接也放到评论区了。
大家可以自己进去拆一遍、修一遍、再装回去,实际玩一下会比只看截图直观很多。
做到这里,我才意识到,这个实验真正有意思的地方,根本不是 GPT-6 会不会做 3D。
因为从头到尾,我自己既不会建这辆探测车,也不知道一个火星探测车维修游戏正常应该怎么设计。
我真正提供的东西,其实只有一个非常模糊的终点。
而 GPT-6 自己把这句话拆成了一个完整产品:需要一台探测车,需要真正的 3D 资产,需要可以独立操作的模块,需要故障系统,需要维修工具,需要重新安装,也需要最后的验收。
其中专业 3D 这一块,它没有自己硬做,而是调用 Hyper3D Rodin,把模型和拆分后的部件拿回来,再继续用于后面的网页和玩法。
这也是我这次真正想测的东西。
GPT-6 不需要自己成为一个 3D 建模师,它需要做的是知道什么时候需要专业能力,然后把 Hyper3D 这样的模型组织进自己的任务里。
做到这里,我突然开始重新想 AGI 这件事。
以前大家聊 AGI,总容易把它想得特别玄乎。
好像它得先把人类几十年没解决的数学题做出来,benchmark 全部刷满,聪明到一个普通人已经完全理解不了,才配得上这三个字。
GPT-6 其实已经离这种想象很近了。
FrontierMath Tier 4 98%,ARC-AGI-3 99.9%,OpenAI 也说它已经参与解决一些长期没解决的数学问题。
这些成绩当然很夸张。
但说实话,真正让我觉得这东西可能已经有点像 AGI 了的,反而不是这些分数。
是前面那个火星车。
因为做到一半的时候,我突然发现一个很简单的事情:
GPT-6 根本没必要什么都会。
它不需要自己变成一个顶级 3D 建模师。
我只告诉它,我想要一个可以拆开维修的火星车网页。到了需要 3D 模型的时候,它就去调用 Hyper3D;模型回来以后,它接着写网页,做交互,设计维修流程。
它自己不会的那一块,并没有把整个任务卡死。
反而很像我们平时做事。
一个产品经理不会自己训练模型,一个导演不会自己造摄影机,一个建筑师也不会自己生产水泥。
人厉害的地方,本来就不是什么都会。
而是碰到一个自己没做过的事情,知道先搞清楚要什么,再去找合适的人、工具和方法,最后把事情做出来。
所以我后来越来越觉得,我们可能一直把 AGI 想得太像一个超级天才了。
它不一定要先证明自己比爱因斯坦聪明多少。
更现实的问题其实是:
你给它一件事,它到底能不能自己往下做,遇到不会的地方知道去哪补,最后把结果交回来。
再回头看 OpenAI 自己以前对 AGI 的定义,其实挺有意思。
他们写的是:
highly autonomous systems that outperform humans at most economically valuable work.

这里面最重要的,不是最聪明。
而是两个很朴素的词:
autonomous, work.
这也是为什么,我越来越觉得需要把 Intelligence 和另外一件事分开来看。
Intelligence 决定一个模型能理解多复杂的问题,能推理多深,能做多长的规划。
但 Agency,或者更简单一点说 Execution,决定的是这些聪明最后能不能变成一个结果。
它能不能打开软件,调用工具,检查中间结果,出错以后继续修改,最后把一个任务交出去。

过去几年的大模型其实一直处在一个很奇怪的状态。
我们造出了一个越来越聪明的大脑,却长期把它关在聊天框里。
它可以告诉你 PPT 应该怎么做,但 PowerPoint 还是你打开;
可以告诉你 Excel 公式,但表格还是你填;
可以教你 Blender 应该怎么建模,然后你按照教程自己再干三个晚上。
所以 Computer Use 的意义,我觉得远不只是模型现在会点鼠标了。
它解决的是一个更基础的问题:
怎么让智能真正进入人原本工作的环境。
现实里的大量工作,并没有整整齐齐地躺在 API 后面。
它们藏在 Excel、浏览器、设计软件、ERP,以及各种用了很多年的企业系统里。
API 是机器熟悉的世界,但 GUI 才是大量人类真正上班的地方。
当一个模型可以进入这些环境,再加上 MCP、API 和各种专业模型,它的能力边界就开始发生变化。
这也是我觉得 OpenAI 最近的路线很值得看的地方。
这当然不意味着它不再追求更高的 Intelligence。
更准确地说,Intelligence 正在逐渐变成整个系统的一项基础能力,而产品真正开始反复优化的是另一件事:
这个系统到底能完成多少端到端的工作。
GPT-6 Astra 的官方介绍里,有一句话我印象很深:
built for the hardest end-to-end work.

如果以前评价一个模型,我们首先看 Intelligence,那么评价一个真正干活的 Agent,可能要同时看:
Intelligence × Agency × Reliability × Speed.
任何一项太弱,最后都很难真正交付。
一个模型可以非常聪明,但如果每做一步都需要人确认,操作一次鼠标要等十分钟,或者跑半小时就得把你叫回来救场,那它依然很难真正接走一份工作。
这也是为什么速度到了 Agent 时代,不再只是一个后台工程指标。
Astra 在 OSWorld 2.0 上,完成率从 GPT-5.6 Sol 的 65.7% 提升到了 72.6%;同时,平均任务耗时从大约 75 分钟降到 40 分钟左右。
OpenAI 更新 Codex Harness 后,Mind2Web 上的任务速度也提升到了此前的大约 1.9 倍。
单看这些数字都不算特别性感。
但放到真实工作里,它们代表的是另外一些问题:
这个活能不能做对,要多久做完,需要人盯多久,中间出了问题能不能自己回来。
这些东西最后决定的,不是一个模型聪不聪明,而是你敢不敢把工作真的交给它。
再回头看开头那个 Blender 艺术家的反应,就很好理解了。
Viper 真正受到冲击的,并不是 GPT-6 又在某个 benchmark 上多拿了几分。
他看到的是,一台机器打开了自己每天使用的软件,把原本属于自己的那部分工作做了出来。
Blender、Excel、PCB 让我看到 GPT-6 已经开始进入越来越多人的工作环境。
而 Hyper3D 那次实测让我意识到另一件事:
它的能力边界,也开始不再完全等于模型本身的能力边界。
它可以把一个外部的专业模型,变成自己完成任务的一部分。
所以写到这里,我越来越觉得,我们可能永远等不到一个像科幻电影一样清晰的 AGI 时刻。
GPT-6 当然还不会世界上的每一种技能。
但如果我们曾经等待的 AGI,是一个能够理解陌生目标、找到合适的工具,并独立完成越来越多工作的通用系统,那么它可能已经不再只是一个未来概念。
它没有伴随着烟花,也没有因为某一道百年数学难题被解开而宣布降临。
只是某一天,你打开电脑,发现它已经坐在工位上了。








