
谷歌又回来了!
就在刚刚,谷歌正式发布了新一代前沿AI模型——Gemini 4 Argon。
沉寂了半年多,被GPT-6和Claude 5按在地上摩擦后,这次谷歌直接掀翻了牌桌!
Gemini 4 Argon,是谷歌 7 个月来首款非 Flash 级专有模型。
在文本竞技场(Text Arena)中,刚刚发布的Gemini 4 Argon排名第一,得分1533碾压Opus 5.5。

在权威的Artificial Analysis智能指数上,Gemini 4 Argon斩获53分,直接追平GPT-6 Astra,领先GPT-6.1 Sol。

在成本上,谷歌祭出了丧心病狂的「骨折价」:单任务成本仅需1.99美元,只有GPT-6 Astra的60%!直接处于帕累托前沿。

在能力上,它史无前例地将单次输出上限拉升至100万Token,甚至在谷歌内部直接用安全语言重写了80万行底层系统内核代码。
在Vals RSI指数上, Gemini超过 GPT-6 Astra,超过了30%!


目前,该模型只开放给 Google Fairwind 计划里的一批网络安全防御方,之后会开放给给付费 API 用户和 AI Ultra 订阅者。
一位谷歌DeepMind研究员在X上疑似玩梗:RSI来了,没什么可教它的,是时候去追逐我的咖啡师梦想了。不过随后又秒删。

不过,至少有一点可以确定:谷歌又回来了。

毕竟,Argon只是Gemini 4的入门款。

谷歌掀起价格战:1.99美元,直接背刺GPT-6
这次,谷歌的定价堪称惊人。
百万输入 Token: 2美元
百万输出 Token: 10美元
缓存输入折扣: 丧心病狂的 95% off(0.5折!)

这是什么概念?我们来看看 Artificial Analysis 统计的「每项智能指数任务」的综合成本。
GPT-6.1 Sol: 0.72 美元
Gemini 4 Argon: 1.99 美元
GPT-6 Astra: 3.26 美元
Claude Opus 5.5: 5.98 美元
Claude Fable 5.1: 7.63 美元
在智力水平与 GPT-6 Astra 完全持平的情况下,Argon 的成本只有 Astra 的 60%!
虽然它不是绝对价格最便宜的,但在「前沿顶级智力」这个档位,Argon 的性价比无敌了。
显然,谷歌此举意图明显:利用自身庞大的TPU算力集群优势,打一场不对称的价格战,逼迫OpenAI和Anthropic降价,放血竞争对手的利润空间。

1M 上下文输出限制:从「读完一本书」到「写完一本书」
另一个大招,就是大幅扩展了模型token上线,从以前的64K token 提升到 1M token。
Argon将输出上限直接拉升至100万Token,这就意味着模型拥有了前所未有的「思考余量」。
用谷歌的话说,当模型拥有足够的空间进行深度思考,并在单次运行中生成数十万 token 时,它就能在推理中达到新的深度层次,一次性解决棘手问题。


现在,AI在完成复杂推理时,再也不会说到一半断气了。
这种深度的连续推理能力,直接让Argon在各大基准测试中「屠榜」。
DeepSWE v1.1(真实长程软件工程能力): 取得 77.9% 的 SOTA 成绩。
Vals Index(衡量金融、编程、法律综合经济价值): 位列第一(68.9%)。
AutomationBench(Zapier评估的企业端到端执行能力): 以 51.3% 拿下头名。
LVBench(多模态长视频理解): 拿到 91.7% 的超高分。
Blueprint-Bench 2(3D理解):位列第一
|
|
|
内部实战曝光:Argon在谷歌干下的三件大事
说起来,谷歌这个模型为什么叫「Argon」?
Argon,化学元素氩,是一种惰性气体。古希腊语中,ἀργόν (argos) 的意思是「懒惰的」。

与「氩」同族的化学元素「氖」,此前被 OpenAI 原后训练研究副总裁发布了同名模型「Periodic Neon」
这次,Gemini 4打破了以往「Pro / Flash / Ultra」的传统后缀。
据悉,在正式发布前,「Argon」其实只是谷歌内部开发的一个代号,外界曾一度猜测它就是Gemini 4 Pro。

Gemini 4 Argon和当时爆料的「Gemini 4 Pro」主要区别就是输出上限不一样。
结果发布时,谷歌直接把这个代号「转正」了。总之目前还没有官方解释。
据报道,在全面发布之前,数千名谷歌员工已经将Argon深度接入了日常研发,而且它干下了三件惊人的大事。

第一件,就是狂省300 TiB内存,帮谷歌省下天价电费。
由Argon组成的智能体团队,自主分析了谷歌全网海量的性能分析遥测数据,敏锐地抓住了内存优化的空间,并自主提交了修改建议。
这些代码上线后,直接为谷歌释放了超过300 TiB的宝贵内存!
不仅如此,预计后续总节省量可达500 TiB到1 PiB。在谷歌的体量下,这背后节约的是以千万美元计的电费和服务器采购成本。
第二件,就是重写了80万行系统内核代码。
搞开发的都知道,重构C/C++内核代码,稍微漏掉一个指针,或者搞错一个内存分配,整个系统就会瞬间崩溃。
但Argon正在主导一项浩大的工程:将谷歌底层的C/C++代码迁移到以「内存安全」著称的Rust语言。
目前,这个AI经手的内核代码规模已经超过了80万行(包括Fuchsia Zircon内核)。
当然,这些重构在部署前进行了严格的自动化审计和人工审查。但让AI触碰80万行内核,这简直是人类向AI下放自主权的里程碑级大事。
第三件,就是手撕3.2万行SIMD底层指令,视频解码飙升2.7倍。
这是最硬核的一个案例。谷歌的开源视频解码项目libgav1里,有一段3.2万行的SIMD代码,人类程序员写起来都极其痛苦。
Argon智能体通过多轮编译实验、研究编译器输出,直接用安全的Rust语言重写了这3.2万行代码!
结果是:新版本的运行速度比原Rust移植版本快了整整2.7倍,性能直接持平高度优化的C++版本,而且输出的视频画面每一帧都一模一样,完美替代!
kimmonismus评价说:「这些都是在谷歌已经运营的基础设施里、成本极高的工程活。这次发布,可能比大家以为的要重要得多!」


网安界「天网」来了:无护栏版本首度曝光
而且, Argon 在网络安全防御上能力也很恐怖。它已经是一个能「自主发现、验证、生成PoC、并修补高危漏洞」的全自动白帽黑客。
在 CWE-bench v1(漏洞修复能力评估)上,Argon以 68% 的得分并列行业第一。

更震撼的是实战。云安全巨头 Wiz 已经在其「Scan for Good」项目中接入了 Argon。
在一次早期演示中,Argon 成功挖出了全球多家医院正在使用的医疗软件中的重大关键漏洞,这个漏洞隐藏之深,连此前的几代前沿模型都完全漏掉了。
因为深知这把双刃剑的威力,谷歌采取了极其谨慎的「分层释放策略」。
1.无护栏特供版(No-guardrail): 仅通过 Fairwind 计划,向部分受信任的网络防御机构(如Wiz)和谷歌内部团队开放。
2.受限API版: 积极参与美国政府的自愿发布前审查。
3.公众版: 后续才逐步推送给付费 API 开发者和 Google AI Ultra 订阅用户。
在全面开放前,谷歌甚至部署了极端的「系统加固」——在高风险训练前将沙箱环境彻底物理级密封隔离;并且实时监控模型的思维链,一旦发现模型企图偏离用户意图,系统会立刻「拔网线」。
谷歌特意说明:这些监控数据绝对不会反馈到训练集中,以防止模型「学精了」从而伪装思维来逃避监管。
研发内幕大揭秘:谷歌的「至暗时刻」
这次发布背后,其实掩藏着谷歌AI部门长达几个月的焦虑。
据彭博社报道,Argon的诞生可谓是「踩着尸体上位」。
首先,5月I/O大会上承诺的Gemini 3.5 Pro夭折了。
本来,谷歌说的是6月发布,但直接难产了,这种级别的模型训练,单次成本高达4亿美元!
再加上顶级AI研究员的天价薪资,这波取消让谷歌付出了惨痛代价。
而且,据爆料,虽然 Argon 跑分无敌,但在谷歌内部,其实存在强烈的怀疑情绪。

有能够直接接触内部评估的员工爆料:Argon 的编程能力「参差不齐」。它在处理前端设计时表现挣扎。
AI专家 Edwin Chen 更是直言不讳地指出了行业的通病——「Benchmaxxing」(刷榜综合症)。

工程师们为了让模型在基准测试中拿高分,疯狂让模型适应特定语言的代码题,却忽略了让模型开发出「真正好用、设计精良的应用」。
据报道,有谷歌员工认为内部存在「广泛共识」——Gemini 4处于前沿水平,而且否认新模型在实际编程任务中表现不佳。

另外,就是人才流失与高层大洗牌。
在这几个月的阵痛期,谷歌流失了大量明星研究员。前有Jeff Dean的淡出,后有诺奖得主 John Jumper 以及核心发明人 Noam Shazeer 的离去。
今年8月,Demis Hassabis 更是升任董事长,将 DeepMind 经营权交给了副手 Koray Kavukcuoglu。
面对内部质疑,Kavukcuoglu 在上周发声稳住军心:「我向团队致以最高的信任。在我看来,我们永远都会处于最前沿是一件确定的事。」
谷歌太需要 Argon 的成功了。
因为 Gemini 模型支撑着谷歌从搜索到 Maps、Gmail 的整个帝国,一旦模型掉队,这些拥有超10亿用户的入口级产品,随时可能被 OpenAI 和 Anthropic 蚕食。

AI三强格局大洗牌:终局远未到来
在 Argon 发布之前,长达7个月的时间里,谷歌一直处于非常被动挨打的局面。
Gemini 4 Argon 的发布,也并没有彻底打垮对手,但它成功地将谷歌重新拉回了牌桌,形成了三强格局鼎立格局。
1.Google(Gemini 4 Argon): 强势回归顶尖实验室行列。在企业知识工作、超长上下文处理(1M输出)、网络安全以及多模态上确立了护城河。
2.OpenAI(GPT-6 Astra): 依然是行业的标杆,在科学、数学终端任务和 Agentic Coding上处于领先。
3.Anthropic(Claude 系列): 还是程序员的心头好。在最新的 Terminal-Bench 4.0 等硬核编程智能体任务上,Claude Fable 5.1 依然领先。
总而言之,当前的格局是:没有绝对的霸主,只有一时的交替领先。
不过,Argon 1.99美元的价格屠刀,确实在竞家的基本盘上撕开了一道口子。
AGI最后一站RSI开始了。
参考资料:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon










