Token导航 LogoToken导航

谷歌发布旗舰模型 Gemini 4 Argon

更新时间 2026-10-01来源 苍何AI正文 1729字阅读约 6分钟9 张图片
这是苍何的第 605 篇原创!

大家好,我是苍何。

猜到它会来,但没猜到它又赶在这个点发布。

就在昨夜凌晨,当我们还沉浸在梦乡的时候,谷歌发布了他们家新的旗舰模型 Gemini 4 Argon。

Gemini 4 Argon 太猛了,多项基准测试能力都超过了 GPT 6 Astra,Claude Opus 5.5。

图片

特别是在 DeepSWE v1.1(真实软件工程任务)以 77.9% 位列全球第一。Vals Index、AutomationBench 均拿第一。

图片

谷歌一共公布了 18 项测试:Argon 独占第一 12 项,并列第一 1 项;GPT 6 Astra 赢 3 项;Opus 5.5 赢 2 项。

图片

谷歌如今再次重回人工智能领域三大顶尖实验室之列。

图片

Gemini 4 Argon 是 Google DeepMind 七个多月以来推出的首款高于 Flash 级别的自主研发模型。

凭借其高推理能力(目前最高级别),它在人工智能分析智能指数 (AII) 中获得 53 分,与 GPT-6 Astra(最高分 53 分)持平,比 GPT-6.1 Sol(最高分 52 分)高出 1 分,其得分提升主要得益于更少的幻觉和更强的自主能力。

在 AA-Omniscience 测试中,Gemini 4 Argon 的幻觉率仅为 15%,是所有智能指数得分 45 分以上的模型中最低的,

输出上限更是直接拉到 100 万 token(之前 64K),业界第一。支持文本、图像、视频和语音输入,并输出文本。

API 价格方面,标准价格为每百万输入/输出令牌 4 美元/20 美元,目前优惠 50%,价格为 2 美元/10 美元。缓存输入令牌可享受 95% 的折扣(折扣价为每百万 0.10 美元),高于 Gemini 3.8 Flash 的 90% 折扣。

图片

智能体性能历来是 Gemini 模型的弱项,但 Gemini 4 Argon 在各项智能体评估中均有所提升。它在 AutomationBench-AA 测试中以 77.5% 的成绩位列第一,比 Claude Sonnet 5.5(最高分 71.3%)高出 6 分。

第三方评测 Artificial Analysis 数据如下:

图片

Gemini 4 Argon 主打长程复杂任务:软件工程、金融/法律知识工作、网络安全防御。

数千名谷歌员工强调了该模型在专业编码任务、深度研究和高质量写作方面的优势。

谷歌还放出了一篇博客文章,放了一些他们的 case,他们利用 Argon 帮助量子计算研究人员优化那些限制重要应用性能的子程序的时空资源(量子比特 × 量子门)。例如,在短短几分钟内,它就将性能提升了 40%,超过了已发布的基准水平。

图片

他们还拿 Argon 做内部的内存优化, Argon  Agent Team 分析了整个集群的分析遥测数据,自主识别并应用了 Google 数据中心的内存优化,一旦推出,即可释放超过 300 TiB 的内存,预计总共可节省 500 TiB 到 1 PiB 的内存。

在大规模代码库迁移与优化工作中,Argon 团队正在将 Google 各部门的 C/C++ 代码库迁移到 Rust,迁移规模从 re2、libgav1 等核心库的数万行代码,到 Fuchsia Zircon 内核的 80 万多行代码不等。

如此大规模的代码迁移,对模型能力的考验不是一点半点。

图片

不过可惜的是,现在大部分人还无法使用,先开放给可信网络安全防御者,之后轮到付费 API 和 AI Ultra 用户。

希望你不要像某些家伙一样吧,快放出给测测。哈哈哈

图片

没拿到测试,在当下,我认为,Claude Opus 5.5 依旧是神,那种爽感,是完全不一样的。

如果 Gemini 4 Argon 比不过 Opus 5.5,大概率就是在拉。

还有,我不知道为什么每次,这帮人老喜欢在中国的节假日发布新模型,太气人了。

国庆第一天,别人在高速上堵车,我在电脑前熬夜看跑分,麻了。

模型不放假,我们也别想放假,苦了。

吐槽归吐槽,谷歌这次确实拿出了真东西。

100 万 token 输出、80 万行代码迁移、300 TiB 内存优化,都是谷歌在自家业务里实打实跑出来的。

但讲真的,跑分这东西,看看就好。

官方数据里 Argon 横扫一片,到了第三方评测,也就和 GPT 6 Astra 打个平手。

发布会看跑分,干活还得看手感。

等 Argon 正式开放,我第一时间拉真实项目去测,到时候再给大家出一期实测。

大厂卷得越凶,我们这些用模型的人就越爽。

你觉得 Gemini 4 Argon 能打得过 Opus 5.5 吗?评论区聊聊。

文章标签GeminiGoogle模型发布学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多