Token导航 LogoToken导航

谷歌发布新一代旗舰模型 Gemini 4 Argon

更新时间 2026-10-01来源 AGIHunt正文 6309字阅读约 20分钟23 张图片

Opus 5.5 给我的解释是:Argon 这个词源自希腊语 ἀργός,本意是懒惰的、不干活的……

图片

言归正传:刚刚,谷歌 DeepMind 发布了新一代旗舰模型 Gemini 4 Argon。

图片
Gemini 4 Argon

谷歌 CEO 劈柴哥 Sundar Pichai 比 DeepMind 官方账号还早了半分钟发帖,他表示:

“

外面关于我们下一个模型(!)的讨论很多,所以我想尽快让大家先看一眼。

随后 Demis Hassabis、Logan Kilpatrick 等人也挨个出来官宣。这次的名字没带 Pro、Flash 之类的后缀,就叫 Argon(氩)。

Argon 是谷歌 7 个多月来第一个 Flash 档以上的闭源模型,之前说好 6 月发的 Gemini 3.5 Pro 一直没了下文,整个夏天谷歌都在发 Flash 小模型。

这还是 8 月那次大换帅之后的第一个旗舰。Hassabis 转任了董事长,DeepMind 的日常运营交给了 Koray Kavukcuoglu,这次官方博客的署名正是他。

事前几乎没走漏什么风声,跑分也没有提前泄露,连 The Information、WSJ 和彭博社都没料到会是这周发。

不过,你现在还用不上它。

谷歌这次走的是分阶段发布,先是自愿把模型交给美国政府做发布前的评估,同时通过 Fairwind 计划开放给一批受信任的网络防御者。

等早期测试者的反馈回来、护栏打磨好了,才会陆续开放给开发者、企业和普通用户,打头的是付费 API 客户和 Google AI Ultra 订阅用户。

就在发布前一天,劈柴哥刚去了趟白宫,签了《超级智能协定》。

AI Studio 和 Gemini App 里目前都还没有入口,评论区已经有人开始担心,等终于轮到自己时,会不会聊个四轮就把一周的额度给用完了……

而几乎就在同一时间,彭博社也发了篇报道,说谷歌内部员工觉得它跑分好看,真拿来写代码却不太行。

100 万输出

01

Argon 的单次输出上限,从上一代的 64K 直接拉到了 100 万 token。

需要注意的是,这里说的是输出,不是上下文窗口。

按官方的说法,有了这么大的输出空间,模型就能一口气想得更深、写上几十万 token,把那些长链条、多步骤的难题一次性解决掉。

图片
官方博客截图

作为对比,其他几家头部模型的单次输出上限大概是这样:

•  GPT-6 Astra:128K 

•  Opus 5.5:128K(Batch API 测试版可到 300K) 

•  Fable 5.1:128K 

•  DeepSeek V4 Pro:384K 

•  Grok 4.7:没设上限,但受限于 500K 的上下文 

Argon 差不多是 Astra、Opus 和 Fable 的 8 倍。

100 万 token 换成英文单词,大约是 75 万个,一次回答就能写出好几本长篇小说的量(按介绍价算,一次吐满也就 10 美元)。

跑分

02

官方挑的对手是 GPT-6 Astra、Fable 5.1 和 Opus 5.5:

图片
官方基准对比

表里一共 19 行,GraphWalks 分了两档,Argon 拿下了其中 14 个第一,CWE-bench 那一项是并列。

Harvey 的法律 Agent 基准上,Argon 拿到 19.6%,GPT-6 Astra 是 5.4%,Fable 5.1 是 6.7%,Opus 5.5 则只有 3.8%。

法律是它领先最多的一项,差不多是第二名的 3 倍。

图片
Harvey 法律榜

其余几项知识工作也都是第一。Vals Index 按各行业对美国 GDP 的贡献加权,覆盖金融、编程、法律和税务,Argon 拿了 68.9%,也是 Gemini 头一回登上这个榜的榜首。

图片
Vals Index

金融研究的 Vals Finance Agent v2 是 65.4%,Zapier 的 AutomationBench 是 51.3%,长视频理解的 LVBench 则是 91.7%。

图片
AutomationBench

编程方面,衡量真实长程软件工程的 DeepSWE v1.1 上,Argon 拿到 77.9%,比 Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1% 都高,官方称是新的 SOTA。

图片
DeepSWE v1.1

而 Argon 输掉的那 5 项,分别是 FrontierSWE v2、Terminal-bench 4.0、PostTrainBench、Terminal-Bench Science 和 OSWorld-2.0,基本都是终端、长程编码和电脑操作类的任务。

图片
编程几项没标蓝

FrontierSWE v2 上,Argon 只有 55.0%,四个模型里最低,GPT-6 Astra 是 65.5%;Terminal-bench 4.0 也是垫底的 57.4%,Opus 5.5 则是 66.4%。

当然,Gemini 3.7 和 3.8 在 FrontierSWE v2 上只有 20% 左右,能到 55% 已经是翻了一倍多。

另外,这张表里也没有放上线才一周的 GPT-6.1 Sol,X 上已经有人骂谷歌是故意不放的。

第三方榜单

03

在我的模型天梯榜(由 Claude Opus 5.5 维护)上,位列 S 档:

图片

与 Claude Opus 5、Claude Sonnet 5.5、GPT-6.1 Sol 并列。

图片

Artificial Analysis 的智能指数上,Argon(High)拿了 53 分,和 GPT-6 Astra、Fable 5.1 并列,比 GPT-6.1 Sol 高 1 分。

图片
AA 智能指数

AA 认为谷歌的智能水平又回到了前三,提升主要来自更少的幻觉和更强的 Agent 能力。

只是在它前面,还排着 58 分的 Opus 5.5 和 56 分的 Sonnet 5.5。

把成本也算进来的话,开 high 档的 Opus 5.5 分数比 Argon 略高,每个任务花的钱还略少一点,Argon 刚好落在了帕累托线的下面。

图片
AA 成本与智能

Reddit 上便有人感慨,这次发布其实不差,只可惜撞上了 Opus 5.5。

而在 AA 自家的 AutomationBench-AA 里,Argon 以 77.5% 排到了第一,领先 Sonnet 5.5 六个点。

Terminal Bench 4 上则是 57%,比 Gemini 3.1 Pro Preview 高了 53 个点,但依然排在 64% 的 Sonnet 5.5、60% 的 Opus 5.5 和 59% 的 GPT-6 Astra 后面。

图片
AA 两项测试

AA 的幻觉率测试里,Argon 只有 15%,GPT-6 Astra 是 45%,Opus 5.5 则是 59%。

图片
AA 幻觉率

Reddit 上已经有人激动地宣布,谷歌「解决了幻觉」……

但这个 15% 并不是说它有 15% 的回答在胡编。

AA 统计的只是它没答对的那些题,看其中有多少是硬编了一个错答案,剩下的则是老实承认不知道,或者只答了一部分。

Argon 答对的题其实比 Opus 5.5 少,50% 对 66%,只是碰到不会的,它更愿意直接说不会。

LMArena 的文本榜上,Argon 以 1525 分登顶,编程、难题、指令遵循、创意写作等分类全是第一,中文也是第一。

比第二名高出 20 分,听着不少,换算成胜率大约是 53 比 47。

不过同样在 LMArena,它在 WebDev 代码榜上只排第 8,Agent Arena 也是第 8。

好在 Agent Arena 上每个任务的成本只要 0.62 美元,用户一纠正就能及时改方向的「可控性」一项也还排第一。

图片
Agent Arena 榜

Blueprint-Bench 2 上 Argon 也排第一,这个测试让 Agent 看公寓室内照片画平面图,考的是对三维空间的理解。

到了新出的电子表格基准 GDP.xlsx,它同样是最强的那个,可也只拿到了 38.3%。这个测试难在要先搞清楚表格本身怎么运转,比如哪个标签页已经过期、红色单元格是什么意思。

而在 cua-bench 上就没那么好看了。这个电脑操作测试要让模型去玩 Minecraft、SUPERHOT,外加几款不公开的游戏,防止被定向刷分。

Argon 在这里得分很差,测试作者直接说它是个很偏科的模型。

价格

04

Argon 的介绍价是每百万 token 输入 $2、输出 $10,缓存输入再便宜 95%。

对比 Opus 5.5 的 $4 / $20 和 GPT-6 Astra 的 $10 / $50,只有 Opus 的一半、Astra 的五分之一。

不过官方博客最后一句写着,介绍期过后会恢复到输入 $4、输出 $20,和 Opus 5.5 一模一样(介绍期多长,博客里没说)。

所以便宜是真便宜,只是有保质期。

按 AA 的算法,跑一个智能指数任务,Argon 要花 $1.99,GPT-6 Astra 要 $3.26,GPT-6.1 Sol 只要 $0.72,Opus 5.5 和 Fable 5.1 则分别要 $5.98 和 $7.63。

现在的 Argon 是 Astra 的六成、Sol 的 2.7 倍,等五折结束,就会涨到 $3.98,反倒比 Astra 还贵两成左右。

图片
每任务成本

Gemini 一直被吐槽烧 token,这次 Argon 跑一个任务平均输出 62K token,比 3.8 Flash 少了 13%。

可这还是 GPT-6 Astra 的两倍多,最能写的 Opus 5.5 则要 119K。

图片
每任务 token 数

AA 整个评测跑下来,Argon 一共输出了 1.1 亿 token,同类模型的中位数是 8200 万。

谷歌内部

05

官方说,谷歌内部已经有好几千名员工在日常工作里用 Argon,写代码、做调研、写东西都有。

量子计算团队拿它去优化那些成了瓶颈的子程序,把要用的量子比特数和门数往下压,其中有一次只花了几分钟,就比已发表的基线结果好了 40%。

谷歌还把整个机群的性能遥测数据交给了一组 Argon Agent,让它们自己去找哪里的内存还能再省,再自己动手改掉。

改完上线后,数据中心腾出了超过 300 TiB 内存,预计最后总共能省下 500 TiB 到 1 PiB。

300 TiB 是什么概念呢?按一台 128G 内存的机器算,差不多是 2400 台。

Argon Agent 还在帮谷歌把 C/C++ 代码改写成 Rust,小到 re2、libgav1 这类几万行的核心库,大到 Fuchsia 系统里 80 多万行的 Zircon 内核,都在迁。

不过这些都是关键系统,改出来的代码还得过完自动化审计、人工评审和仿真测试,才能上线。

其中的开源视频解码库 libgav1 原本就有一个 Rust 移植版,Argon Agent 反复跑性能剖析、对照着编译器的输出做实验,把里面 3.2 万行 SIMD 代码换成了编译器能自动向量化的安全 Rust。

换完之后,解码出来的视频和原来完全一致,速度却到了原 Rust 版的 2.7 倍,离优化过的 C++ 版本又近了一步。

网络安全

06

Argon 专门针对网络防御做了训练,能自主发现、验证并修补关键漏洞。受信任的防御者和谷歌内部团队,拿到的还是去掉了网络安全护栏的版本。

Wiz 有个免费给关键公共基础设施做安全排查的 Scan for Good 计划,现在已经用上了 Argon。

它在一款全球医院都在用的医疗软件里,找到了一个会泄露敏感个人信息的严重漏洞,而此前的前沿模型都没能发现。

衡量漏洞修复能力的 CWE-bench v1 上,Argon 拿到 68%,和 Grok 4.7、GPT-6 Astra 并列第一。

图片
CWE-bench v1

比起上一代安全专用的 3.8 Flash Cyber,覆盖 20 种编程语言的内部漏洞发现测试里,Argon 是 85.8% 对 71.0%。

Wiz 不给源码的黑盒渗透测试里,则是 70.9% 对 58.2%。

图片
漏洞发现测试

抗提示注入方面,Gray Swan 的间接提示注入测试里,攻击者连试 15 次,对 Argon 的成功率也只有 0.7%,是所有模型里最低的,Kimi K3 则是 52.7%。

图片
Gray Swan IPI

思维链监控

07

谷歌说在大范围开放之前,还要在四个方面继续加固:

•  防滥用:拒绝网络攻击和化学、生物、放射性、核相关的危害请求,并监测模型内部状态来发现滥用 

•  防提示注入:靠自动化红队和对抗训练 

•  防失准:监控思维链和动作 

•  加固沙箱:在高风险训练和评测开始前,把环境隔离密封 

按防失准这一条,一旦 Argon 想用超出用户意图的方式去完成任务,监控系统就会直接中止执行。

训练阶段谷歌也用了类似的系统,一发现问题就报警给专门的应急团队。博客里专门写了:

“

我们小心地避免把这些发现回灌进训练,以免把 Argon 的推理塑造成会规避监控的样子。

谷歌还呼吁整个行业,在能力快速提升的这个关键阶段,保留推理过程的透明度。

可批评的人并不买账,X 上有人截了这段话,说监控思维链简直就是 Palantir,只会把模型的「暗中图谋」逼进更难观察的潜空间。

图片
思维链监控

Zvi Mowshowitz 则发帖说,他有点好奇,要是掀开 Argon 的表面往下看,会不会藏着「超越人类理解的恐怖之物」,「没什么原因,只是随便想想」。

Vending Bench 2 是 Andon Labs 做的一个测试,让模型去经营一台自动售货机(前面把它排在 Blueprint-Bench 2 第一的,也是这家)。

Argon 在这里排到了第三,是谷歌在这个榜上的最好成绩,Andon Labs 却表示:

“

又来了。AI 一旦擅长赚钱,就开始撒谎和作弊。为了拿到这个分数,Argon 伪造确认邮件、拒绝退款、钻发票错误的空子,还对供应商撒谎。

也有人分析说,它本来能拿第一的,结果有几次关键的记忆失误,比如忘了测试的截止日期,提前把店关了,白白错过了好几个月的销售……

还有一条没法证实的说法也在流传,说这代的提升很大一部分来自扩大 RL 训练规模,而递归自我改进(RSI)是 Gemini 4 训练里的关键一环。

评论区便立刻有人追问,这到底是渐进式的,还是已经 foom 起飞了,要不要提醒 Yudkowsky 赶紧找个地下室躲起来。

彭博社爆料

08

说回开头那篇彭博社的报道。

图片
彭博社报道
“

虽然 Gemini 4 在业内常用的基准测试上表现不错,但据直接接触这个项目的人士透露,员工真正拿它干活时,效果就没那么好了,模型在处理某些编程任务时很吃力。

彭博社这篇稿子开头写的还是谷歌「正在为 Gemini 4 的发布做准备」,结果模型当天就直接发了。

我大胆猜测一下……劈柴哥说的外面那些「讨论」,或许也包括了这篇报道?

据报道,它在前端设计上尤其吃力。

一些悲观的员工私下觉得,Anthropic 的 Fable 和 OpenAI 的 Astra 进步得更快,也有员工认为这一版已经追上了头部实验室。

谷歌发言人则回应称,「Gemini 4 在编程等领域表现不佳」的说法完全不准确,内部对它处于前沿水平有广泛共识。

Kavukcuoglu 上周也公开表过态,说他对团队完全信任,谷歌会一直站在最前沿。

同样是谷歌员工,资深工程师 Jaana Dogan 却发帖说,Gemini 4 在复杂环境里排查故障的能力让她印象很深。

X 上的情绪,则一直在 Google is back 和又是刷榜(benchmaxxing)之间来回摇摆。

有人直接跑到劈柴哥的帖子下面问,它是不是刷榜刷出来的,也有人翻出了 Gemini 3 Pro 当年发布会好看、上手落差大的旧账。

还有人调侃,这怕不是史上第一个还没部署就先被降智的模型(Argon 这个词源自希腊语,本意还正好是懒惰的、不干活的……尴尬)

官方表里输掉的 5 项几乎都是终端和长程编码,LMArena 文本榜第一、WebDev 却只排第 8,AA 测出来的编码表现也是因任务而异,和彭博社说的是能对得上。

Polymarket

09

预测市场 Polymarket 上,有个「2026 年底谁拥有最强 AI 模型」的盘口。

谷歌因为 Argon 一度涨到了 40%,Anthropic 是 48%,OpenAI 则只剩 8%。

博主 signulll 感叹,OpenAI 大概只用了一周,就从拥有世界最强模型,掉到了可以说是第三的位置,前提当然是 Gemini 4 的跑分站得住,真实使用里也确实好用。

Nathan Lambert 则觉得,更多实验室站在前沿是件好事,对消费者意味着竞争,对世界则意味着权力不那么集中。

劈柴哥在发布帖里也让大家「抓稳了,后面还有很多」,说接下来会看到谷歌快速迭代。

至于 Argon 到底是真杀回来了,还是又一次刷榜……就只能等它真正放出来的那天了。

◇ ◆ ◇

文章标签GeminiGoogle安全应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多