谷歌把旗舰端上了桌,头一轮筷子却没发给开发者。
10 月 1 日,这家公司正式发布前沿模型 Gemini 4 Argon。官方说法是走 Fairwind 计划,先交给一批受信任的网络安全防御者,付费接口客户和 AI Ultra 订阅者排在后面,更广的开放没给日期。距离上一次拿出旗舰级模型,中间空了将近十个月。
01 真正的增量是那条绳子
参数、排名这些词大家已经听腻了。这次值得盯的是另一个数。
Argon 把单次输出上限从上代的 6.4 万 token 拉到了 100 万。它和上下文窗口不是一回事,决定的是模型能在一条任务里连着干多久,才把控制权交回给你。
同档次的模型,单次输出大多卡在 12.8 万上下。过去让模型干长活,人得自己把它拆成一串来回。多一次往返就丢一层中间状态,还得重新对齐目标。一条线跑完的意义不在省事,在于那些推理不至于中途丢掉。
谷歌为什么要这么长的绳子?看它自己摊开的三件内部活就清楚了。

量子算法里,它几分钟就把公开文献里的时空资源开销压低了 40%;数据中心那边,一群智能体啃全集群的性能遥测数据,自己找出内存优化点,上线后释放出 300 TiB 以上;还有代码迁移,把内部的 C/C++ 往 Rust 搬,从小库的几万行一路干到 Fuchsia 内核的 80 多万行。
最具体的是 libgav1 这个开源视频解码器。智能体拿一个现成的 Rust 移植版下手,替换掉 3.2 万行 SIMD 代码,最后跑出来的东西比原版快 2.7 倍,画面输出一帧不差。
02 成绩单要挑着读
DeepSWE v1.1 上它拿到 77.9%,压过 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%。衡量经济价值的 Vals 指数以 68.9% 排在四十多个模型的头名,法律基准 Harvey 拿到 19.6%,接近另外两个旗舰的三倍。
但剩下的几项才是这篇发布里最值钱的信息。

FrontierSWE v2 上,Argon 得 55.0%,GPT-6 Astra 是 65.5%,差 10.5 个百分点。终端操作 Terminal-bench 4.0 上,Claude Opus 5.5 跑出 66.4%,它只有 57.4%。按 VentureBeat 的统计,谷歌这次公布了 18 项对比,Argon 在其中 13 项拿下单家最高或并列。
落后项几乎都集中在同一类活:贴着真实代码库、开着终端往下改。这类场景的共同点是反馈快、容错低,一步错就得退回来重走,恰恰不是它的强项。
外头独立的口径也没齐。NeuralTrust 汇总多家评测后发现,Artificial Analysis 给 Argon 打 52.6,仍低于 Opus 5.5;The Decoder 那边的结论是它幻觉率只有 GPT-6 Astra 的三成左右,事实准确率却又低于对方。
这是一个强得很不均匀的模型,不是一把通吃的刀。
据虎嗅整理的背景,前一个旗舰 Gemini 3.5 Pro 因为编程表现没达标被按下,这条线中途换过帅,中间一直靠 Flash 系列撑着声量。空缺了十个月,这次发布天然带着翻盘压力,厂商自报的分数发布时还没有任何外部机构复现过,此前有报道说内部员工觉得表现不够好,谷歌否认了。
03 为什么头一批用户是安全圈
Argon 被专门练成了一个会找漏洞的角色:自主发现、验证、再动手修。它在 CWE-bench v1 上拿到 68%,和 GPT-6 Astra 并列最高;安全公司 Wiz 用它扫医疗软件,挖出一个此前所有前沿模型都漏掉的漏洞。
同一个本事换个方向就是风险。谷歌的解法是两头同时拧:给可信的防御者和自家团队提供去掉网络安全护栏的版本,让他们用满;面向更广人开放之前,再补齐滥用防护、提示注入加固、内部激活监测和沙盒隔离。

它同时接入了美方那套发布前的自愿评估流程。这套安排不算姿态,算是刚需:一个能自己写出 80 万行改动的智能体,必须配一套和它体量对等的审核机制,而不是指望使用者自觉。
有报道提到它在提示注入攻击上的被突破率只有 0.7%,对比 GPT-6 Astra 的 8.5%,这是二手转述,先看个趋势。Fairwind 这个计划 9 月初才落地,成员来自云客户、政府机构和几家安全公司,本来就是给这类模型留的缓冲带。
04 收个尾
价格上,尝鲜期是每百万输入 token 2 美元、输出 10 美元,缓存命中再便宜 95%,之后涨到 4 和 20。有外媒按单价对比后认为,尝鲜价大约只有 Opus 5.5 的一半,但这个判断出自转述,不是付费接口的公布口径。
比账单更现实的是审核。一次吐出几十万 token 的改动,人一行一行是看不完的,这类活过去往往是人月级的工程。这也是它宁可先把接口交到跑得动完整链路的安全团队手里,而不是一次放给所有人的原因。
所以这次发布真正该记住的不是哪个百分比。过去两年大家比的是谁答得更漂亮,现在比的是谁能在一条长任务里扛得更久。输出上限、权限分层、分批放还是一次全量放开,全是围绕这件事打转。
至于它到底成不成,得等 Fairwind 那批人把结果交回来,等开发者真正拿得到手的那一刻才有答案,而那个日期谷歌还没给。







