Token导航 LogoToken导航

OpenAI与黄仁勋称AGI已至 业界

更新时间 2026-09-22来源 搜狐科技正文 2284字阅读约 8分钟1 张图片
OpenAI与黄仁勋称AGI已至 业界

人工智能通用智能(AGI)是否已然降临?OpenAI给出了肯定答案。随着最新模型GPT-6 Astra的发布,OpenAI总裁格雷格·布罗克曼(Greg Brockman)直言行业已步入AGI时代。英伟达首席执行官黄仁勋亦持相同观点,在Astra问世后高调宣称“AGI已经到来”。

这些表态折射出业界对前沿AI模型能力的信心激增。然而,此类观点仍属孤立发声,关于AGI是否真正实现的争论远未平息。核心分歧在于,目前业界缺乏公认的AGI定义或客观测试标准。

黄仁勋的背书尤为引人注目。作为支撑当前AI热潮算力基础设施的核心提供商,他今年早些时候曾在播客中表达过类似看法,认为AGI已然存在。

Astra的性能突破与局限

OpenAI将Astra定位为其最智能且对齐度最高的模型,声称其在计算机操作、浏览、软件工程、网络安全、科学及专业工作领域具备最先进的性能。

数据显示,Astra在高难度评估中表现抢眼:在研究级数学问题基准FrontierMath Tier 4上得分98%,在推理基准ARC-AGI-3上得分99.9%,在网络安全基准ExploitBench上更是斩获100%满分。OpenAI还指出,该模型协助解决了长期存在的数学开放性问题。

然而,致力于推动开源AGI发展的ARC Prize基金会明确泼了冷水。该基金会总裁Greg Kamradt撰文指出,饱和通过ARC-AGI-3不应被解读为AGI实现的证明。“我们推出ARC-AGI-3时已明确表示,饱和该基准并不代表‘实现AGI的证明’。尽管Astra代表了向泛化能力迈进的重大进展,但我们并未声称它就是AGI。”

该基准旨在考察代理在不熟悉环境中的表现,但这些环境本质上仍是有界、确定性和封闭式的,与现实世界显著的非封闭式特征存在差异。

因此,支持AGI已来的论点不仅基于单点任务的优异表现,更在于其能在日益广泛的智力和专业任务中运作的能力。这种广义的通用性是AGI论点的核心。

Gartner高级副总裁分析师阿伦·钱德拉塞卡兰(Arun Chandrasekaran)指出,Astra在ARC-AGI-3上的表现为其在不熟悉但有界环境中代理泛化能力的阶梯式提升提供了证据。该测试要求AI代理在无明确指令下,于陌生的抽象回合制环境中探索、推断目标并规划行动。

值得注意的是,Astra在使用OpenAI提供商适配器工具时得分高达99.9%,而在标准的、与提供商无关的工具下,得分仅为62.7%。钱德拉塞卡兰强调:“基准饱和并不确立AGI。现有证据并未证明其在根本不同的语境中具有通用性。”他认为,AGI宣言虽可能影响投资者对OpenAI长期市场机会的预期,但估值最终取决于能力能否转化为持久的收入增长及可防御的竞争地位。

Forrester高级副总裁兼首席分析师查理·戴(Charlie Dai)同样认可Astra在推理、代码工程及多步骤任务执行上的显著改进,远超早期前沿模型。但他补充道:“这代表的是更广泛的能力而非已证实的通用智能,因此AGI仍是一种解释而非既定事实。”

定义模糊与共识缺失

OpenAI曾将AGI定义为“在大多数经济价值工作中超越人类的高度自主系统”。但这一定义留下了巨大的解释空间,未明确规定所需展示的具体能力、可靠性要求及衡量标准。

CleverTap数据科学副总裁雅各布·约瑟夫(Jacob Joseph)表示,尽管AGI通常被归结为能在不同领域推理、具备真正自主性、在未训练场景中学习并达到人类水平的系统,但目前尚无定论。他指出,OpenAI的定义更多是一个经济阈值而非认知阈值,这意味着“AGI”标签更多充当市场信号,而非客观描述。“测试的关键不在于模型能否自称AGI,而在于它在长期的野外无监督、负责任的使用中是否经得起考验。”

这种模糊性至关重要。当前AI模型可能在复杂数学或编码问题上超越人类,但这并不等同于拥有灵活、可靠且能处理非结构化问题的类人智能。戴指出:“尚未得到证实的是,基准测试和专业工作流程中的成功是否能转化为人类水平、领域独立的智能——而对于这一阈值,目前不存在普遍接受的定义或测试。”

AI研究员加里·马库斯(Gary Marcus)则强烈反驳黄仁勋的说法。他在文章中写道:“不幸的是,黄仁勋既没有提供证据也没有给出定义,这感觉像是试图用企业意志接管一个科学问题。”马库斯认为,人类水平的通用智能涉及从经验中可靠地推广至截然不同的情境、展现足智多谋,并以当前大模型尚未达到的可靠性水平进行操作。

约瑟夫进一步指出,由于缺乏共享标准,AGI主张难以独立验证。“AGI没有相当于‘系统卡片’的东西。业界没有达成一致的、可测试的标准,因此这样的声明更像是一种事后提出的标准提案,要求大家事后接受。”他强调,基准测试本质上是人预先设想的任务,难以证明知识迁移到了真正新颖的情境中。“AGI的主张最好通过一段较长的时间来评估,观察系统在越来越非封闭的真实环境中的表现。更有趣的问题是,当没有可以操纵的测试且后果真实存在时,它会做什么。”

未来展望

OpenAI和黄仁勋的论点实质是:AI系统现已能够执行足够广泛的经济价值智力工作,从而跨越了AGI的实践门槛。

戴分析称:“黄仁勋的背书增加了可信度,因为英伟达在前沿AI进展方面拥有独特视角。他的支持应被视为对加速能力趋势的知情验证,而非AGI已实现的决定性证明。”

就目前而言,最稳妥的结论是:GPT-6 Astra代表了前沿AI能力的重大扩展。但它是否标志着AGI时代的正式开启,仍有待时间与更严苛场景的检验。

【星途科讯 图文丨小林 首发于ZAKER科技,转载请注明出处】

文章标签OpenAI
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多