Token导航 LogoToken导航

GPT-6 Astra 使用体验:已具备 AGI 特征

更新时间 2026-09-23来源 01Founder正文 6047字阅读约 19分钟19 张图片
图片

内容|Max

编辑|Max

这个月,我基本是在高强度地用 GPT-6 Astra。

我让它操作软件、写东西、跑长任务,也专门接上 Hyper3D,丢给它一个我自己完全不会做的 3D 项目,看它能不能从一句很模糊的需求开始,自己找工具、做模型、拆部件、写网页,最后把东西真正交出来。

图片

测到后面,我越来越有一个很强烈的感觉:

如果我们过去说的 AGI,是一种能够理解目标、调用工具,并且越来越独立地把工作做完的通用智能,那 GPT-6 可能已经踩进去了。

而我第一次产生这个感觉,其实是因为前两天刷到的一个帖子。

一个叫 Viper 的 Blender 艺术家,转发了 Duncan Trussell 用 GPT-6 Astra 做的一段演示。

Duncan 让 Astra 直接操作 Blender,做了一个完整的 Backrooms 场景。

图片

里面不只是搭几个方块。

建模、灯光、VHS 质感,甚至声音都做了。

Duncan 自己说,整个过程大概用了 5 个 prompt,制作花了 30 分钟左右,最后又用了 20 分钟导出。

然后 Viper 看到了。

他原本一直觉得,自己这些年积累下来的 Blender 技能和艺术感觉,是机器很难替代的一层东西。

结果现在,他看着 Astra 在自己最熟悉的软件里,做出了一个自己可能要花几天完成的场景。

他的第一反应不是兴奋,而是愤怒。

他直接破防了,表示:这他妈像个恶作剧。

图片

我其实很能理解这种感觉。

这几年大家已经看过太多 AI Demo 了。

生成图片、视频、代码,隔一阵就会出现一个看起来很吓人的新东西。

看多了以后,人其实会慢慢脱敏。

但这个 Demo 有一点不一样。

Astra 没有在聊天框里告诉一个 Blender 艺术家你应该怎么做,也不是生成一张看起来像 3D 的图片。

它真的打开了 Blender,进入那个艺术家每天工作的环境,然后开始干活。

看到这里,我第一次有一种很具体的感觉:

AI 已经不再只是坐在 Blender 艺术家旁边回答问题。

它开始坐到他的工位上了。

后来我又去找了很多 GPT-6 的案例。

越看越觉得,Blender 可能只是因为视觉效果最好,所以最容易在社交网络上传播。真正发生的事情,要比 AI 会做 3D 大得多。

比如 OpenAI 拿 Astra 跑过 2023 Microsoft Excel World Championship 的任务。

它不是在聊天框里告诉你 DCF 应该怎么算,也不是生成一段 Python 代码让你自己复制进去。Astra 直接进入 Excel,在人类平时工作的那个界面里完成金融建模。

图片

官方给出的结果是,它完成这些任务的速度大约是当时人类冠军的 4 倍。

这件事听起来没有 Blender 那么震撼,甚至有点枯燥。

但仔细想想,很多工作本来就是这样。

分析数据、调整模型、核对数字、找报表之间的差异,没有任何科幻感,却是很多人每天坐在办公室里花几个小时完成的事情。

GPT-6 开始进入的,恰恰是这些最普通的工作。

再比如音乐。

音乐人 Auggie 只给 GPT-6 Astra 一个要求,让它使用 LilyPond 完成一首巴赫风格的作品。

没有一步一步告诉它旋律怎么写,也没有替它设计后面的结构。

图片

Astra 在 Extra High 模式下持续工作,最后交出来的不是几小节旋律,而是一份完整、可以继续使用的乐谱文件。

真正困难的地方不只是生成几个听起来像巴赫的音符,而是要在更长的过程中保持前后的结构,把主题、声部和和声组织起来,最后交出一个可以真正播放的作品。

这和过去在 ChatGPT 里说一句帮我写首歌,已经不太是一回事了。

模型开始接住的,不只是一个问题,而是一段完整的创作过程。

再往硬件那边看,就更具体了。

一个叫 GoFly 的用户,直接把一块 FPV 无人机飞控板交给了 GPT-6 Astra。

它在 KiCad 里从原理图开始,一路做到六层 PCB,自己完成元器件摆放、布线,再跑 ERC 和 DRC 检查。

图片

最后,它还导出了 Gerber、BOM、贴装坐标这些真正会交给工厂的生产文件。

整个过程跑了三个多小时。

更有意思的是,这个东西没有停留在一张看起来像电路板的图片上。

后来这块板真的通过了嘉立创审核并成功下单。

当然,最终能不能正常点亮还要等实物验证,但它至少已经走到了实际制造流程这一步。

把这三个案例放在一起看,事情就开始变得有点不一样了。

Excel、音乐、PCB,看起来横跨三个完全没有关系的行业,但 GPT-6 做的事情其实很相似:

它不再只是站在一个专业人士旁边告诉他应该怎么做,而是开始进入那些人真正工作的环境,把其中一段工作接过去。

看到这里,我也很想自己试一次。

但我不太想再测一遍 GPT-6 会不会操作 Blender。我更好奇的是另一个问题:

如果一个任务走到某一步,碰到了 GPT-6 自己并不具备的专业能力,它会怎么办?

毕竟一个真正的通用智能,也不可能自己掌握世界上所有专业技能。它会停在那里,还是知道应该去找一个更专业的工具,把任务继续做下去?

我决定挑一个自己也几乎完全不会的领域试试。

PART.01
让一个小白起飞
THUMB
STOPPING

我最后选了 3D。

原因很简单,我基本不会。

对 3D 软件的全部印象,大概还停留在高中微机课上摸过几次 C4D,后来基本没再碰过。

现在让我自己从头建一个模型,和零基础没什么区别。

之前我倒是用过 Hyper3D Rodin 做过几个模型,甚至拿生成出来的东西去做过 3D 打印,所以至少知道最后应该得到一个什么样的东西。

这反而很适合拿来做实验。

我不需要判断 GPT-6 的建模手法专不专业,也不打算一步一步教它应该怎么做。

我只想给它一个最后的目标,看看它能不能自己把中间缺的能力补起来。

所以这次我干脆把要求压到最简单,像一个真的什么都不懂的小白一样,只告诉 GPT-6 我最后想要什么。

我给它的原话是:

帮我做一个可以拆开维修的火星探测车 3D 网页吧。
我不懂 3D,具体怎么设计、怎么拆、网页怎么玩你自己想,3D 模型用 Hyper3D MCP 来做,最后给我一个真的能玩的成品。

图片

开始之前只需要做一件事,就是把 Hyper3D 接进 Codex。

这个过程比我想象得简单,在 Hyper3D 官网点开 MCP,把官方给的一段配置提示词直接丢给 Codex,它会自己完成配置,然后拉起浏览器做一次 OAuth 授权。

图片

接好以后,我就基本不管了。

这也是这次测试里我刻意保留的部分。

我没有告诉它火星车应该长什么样,没有规定要拆成几个零件,也没有设计什么维修玩法。

甚至连网页最后应该做成什么样,我都没给参考。

这些东西全让它自己补。

GPT-6 接到任务以后,先判断自己需要一套真正能放进网页里的 3D 资产,于是调用 Hyper3D Rodin 开始生成火星探测车。

整车模型出来以后,它又继续通过 Hyper3D 做拆件,把原本完整的探测车处理成可以独立操作的模块。

最后它自己整理出了控制与通信舱、太阳能板、四个驱动轮等 7 个模块。

图片

中间它只停下来找了我一次。

因为下一步要把 Hyper3D 生成的真实模型下载下来,真正嵌进网页,工具要求我明确确认下载授权。

GPT-6 自己停下来问了一句,我点了允许,它就继续往下跑了。

图片

真正让我觉得有意思的是后面。

我原本只说了一句做一个可以拆开维修的火星探测车网页,最后它自己把整件事设计成了一个叫 ARES 火星维修站 的小游戏。

背景是探测车刚经历了一场沙尘暴。

进入页面以后,右边直接列出了三项需要处理的任务:恢复通信链路、清理太阳能板、紧固驱动轮。

中间则是 Hyper3D 生成的探测车,可以自由旋转,也可以直接检查不同部件。

图片

它也没有把拆件做成一个单纯好看的爆炸视图。

比如点击右前驱动轮以后,系统会先诊断出轮毂固定件松脱,对应的轮子会被高亮出来,然后要求你真的把这个部件从探测车上拆下来。

图片

拆下来以后,还会进入一个单独的维修台。

GPT-6 自己设计了三种维修工具:除尘刷、力矩扳手和校准仪。

不同的问题要选不同的工具,驱动轮松动要重新紧固,通信异常要做信号校准,太阳能板积灰则要一点点清理。

图片

修好之后,再把零件装回探测车,系统重新检查状态。

三个问题全部处理完以后,任务才算结束。

图片

我把最后这个可以直接玩的网页链接也放到评论区了。

大家可以自己进去拆一遍、修一遍、再装回去,实际玩一下会比只看截图直观很多。

做到这里,我才意识到,这个实验真正有意思的地方,根本不是 GPT-6 会不会做 3D。

因为从头到尾,我自己既不会建这辆探测车,也不知道一个火星探测车维修游戏正常应该怎么设计。

我真正提供的东西,其实只有一个非常模糊的终点。

而 GPT-6 自己把这句话拆成了一个完整产品:需要一台探测车,需要真正的 3D 资产,需要可以独立操作的模块,需要故障系统,需要维修工具,需要重新安装,也需要最后的验收。

其中专业 3D 这一块,它没有自己硬做,而是调用 Hyper3D Rodin,把模型和拆分后的部件拿回来,再继续用于后面的网页和玩法。

这也是我这次真正想测的东西。

GPT-6 不需要自己成为一个 3D 建模师,它需要做的是知道什么时候需要专业能力,然后把 Hyper3D 这样的模型组织进自己的任务里。

PART.02
AGI 的关键,不是解决数学猜想,而是把工作做完
THUMB
STOPPING

做到这里,我突然开始重新想 AGI 这件事。

以前大家聊 AGI,总容易把它想得特别玄乎。

好像它得先把人类几十年没解决的数学题做出来,benchmark 全部刷满,聪明到一个普通人已经完全理解不了,才配得上这三个字。

GPT-6 其实已经离这种想象很近了。

FrontierMath Tier 4 98%,ARC-AGI-3 99.9%,OpenAI 也说它已经参与解决一些长期没解决的数学问题。

这些成绩当然很夸张。

但说实话,真正让我觉得这东西可能已经有点像 AGI 了的,反而不是这些分数。

是前面那个火星车。

因为做到一半的时候,我突然发现一个很简单的事情:

GPT-6 根本没必要什么都会。

它不需要自己变成一个顶级 3D 建模师。

我只告诉它,我想要一个可以拆开维修的火星车网页。到了需要 3D 模型的时候,它就去调用 Hyper3D;模型回来以后,它接着写网页,做交互,设计维修流程。

它自己不会的那一块,并没有把整个任务卡死。

反而很像我们平时做事。

一个产品经理不会自己训练模型,一个导演不会自己造摄影机,一个建筑师也不会自己生产水泥。

人厉害的地方,本来就不是什么都会。

而是碰到一个自己没做过的事情,知道先搞清楚要什么,再去找合适的人、工具和方法,最后把事情做出来。

所以我后来越来越觉得,我们可能一直把 AGI 想得太像一个超级天才了。

它不一定要先证明自己比爱因斯坦聪明多少。

更现实的问题其实是:

你给它一件事,它到底能不能自己往下做,遇到不会的地方知道去哪补,最后把结果交回来。

再回头看 OpenAI 自己以前对 AGI 的定义,其实挺有意思。

他们写的是:

highly autonomous systems that outperform humans at most economically valuable work.

图片

这里面最重要的,不是最聪明。

而是两个很朴素的词:

autonomous, work. 

这也是为什么,我越来越觉得需要把 Intelligence 和另外一件事分开来看。

Intelligence 决定一个模型能理解多复杂的问题,能推理多深,能做多长的规划。

但 Agency,或者更简单一点说 Execution,决定的是这些聪明最后能不能变成一个结果。

它能不能打开软件,调用工具,检查中间结果,出错以后继续修改,最后把一个任务交出去。

图片

过去几年的大模型其实一直处在一个很奇怪的状态。

我们造出了一个越来越聪明的大脑,却长期把它关在聊天框里。

它可以告诉你 PPT 应该怎么做,但 PowerPoint 还是你打开;

可以告诉你 Excel 公式,但表格还是你填;

可以教你 Blender 应该怎么建模,然后你按照教程自己再干三个晚上。

所以 Computer Use 的意义,我觉得远不只是模型现在会点鼠标了。

它解决的是一个更基础的问题:

怎么让智能真正进入人原本工作的环境。

现实里的大量工作,并没有整整齐齐地躺在 API 后面。

它们藏在 Excel、浏览器、设计软件、ERP,以及各种用了很多年的企业系统里。

API 是机器熟悉的世界,但 GUI 才是大量人类真正上班的地方。

当一个模型可以进入这些环境,再加上 MCP、API 和各种专业模型,它的能力边界就开始发生变化。

这也是我觉得 OpenAI 最近的路线很值得看的地方。

这当然不意味着它不再追求更高的 Intelligence。

更准确地说,Intelligence 正在逐渐变成整个系统的一项基础能力,而产品真正开始反复优化的是另一件事:

这个系统到底能完成多少端到端的工作。

GPT-6 Astra 的官方介绍里,有一句话我印象很深:

built for the hardest end-to-end work. 

图片

如果以前评价一个模型,我们首先看 Intelligence,那么评价一个真正干活的 Agent,可能要同时看:

Intelligence × Agency × Reliability × Speed. 

任何一项太弱,最后都很难真正交付。

一个模型可以非常聪明,但如果每做一步都需要人确认,操作一次鼠标要等十分钟,或者跑半小时就得把你叫回来救场,那它依然很难真正接走一份工作。

这也是为什么速度到了 Agent 时代,不再只是一个后台工程指标。

Astra 在 OSWorld 2.0 上,完成率从 GPT-5.6 Sol 的 65.7% 提升到了 72.6%;同时,平均任务耗时从大约 75 分钟降到 40 分钟左右。

OpenAI 更新 Codex Harness 后,Mind2Web 上的任务速度也提升到了此前的大约 1.9 倍。

单看这些数字都不算特别性感。

但放到真实工作里,它们代表的是另外一些问题:

这个活能不能做对,要多久做完,需要人盯多久,中间出了问题能不能自己回来。

这些东西最后决定的,不是一个模型聪不聪明,而是你敢不敢把工作真的交给它。

PART.03
其实 AGI 已经到来
THUMB
STOPPING

再回头看开头那个 Blender 艺术家的反应,就很好理解了。

Viper 真正受到冲击的,并不是 GPT-6 又在某个 benchmark 上多拿了几分。

他看到的是,一台机器打开了自己每天使用的软件,把原本属于自己的那部分工作做了出来。

Blender、Excel、PCB 让我看到 GPT-6 已经开始进入越来越多人的工作环境。

而 Hyper3D 那次实测让我意识到另一件事:

它的能力边界,也开始不再完全等于模型本身的能力边界。

它可以把一个外部的专业模型,变成自己完成任务的一部分。

所以写到这里,我越来越觉得,我们可能永远等不到一个像科幻电影一样清晰的 AGI 时刻。

GPT-6 当然还不会世界上的每一种技能。

但如果我们曾经等待的 AGI,是一个能够理解陌生目标、找到合适的工具,并独立完成越来越多工作的通用系统,那么它可能已经不再只是一个未来概念。

它没有伴随着烟花,也没有因为某一道百年数学难题被解开而宣布降临。

只是某一天,你打开电脑,发现它已经坐在工位上了。

感谢您的观看🥹
我是Max,一个在AI方向持续探索的小学生。
我会持续更新一些AI方向最新最快的产品,技术,思考
求各位看官点赞,关注,再看三连🙇
文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多