Token导航 LogoToken导航TokenDH.com

快4.6倍、便宜6.4倍,智能指数却还差7分:谷歌发布 Gemini 3.8 Flash 这波是赶上了还是继续拉?

更新时间 2026-09-04来源 Aike正文 2495字阅读约 8分钟3 张图片

Google 这次发布,最该问的不是"强不强",是"它到底在跟谁比"。

美国时间 9 月 2 日,Google 发布 Gemini 3.8 Flash 和网络安全专精版 3.8 Flash Cyber。距离 Anthropic 的 Fable 5.1 只隔一天,距离自家的 3.7 Flash 只隔三周。

六周里发了三款 Flash。这个节奏本身就是答案的一部分。

背景也值得记一笔。上个月 Hassabis 卸任 DeepMind 日常管理,转任 Alphabet 首席科学家,由副手接手运营,对内明确强调要加快执行速度。两周一更,就是这句话的落地。

一、六周三款 Flash

两个模型同一底层,差别在护栏和开放方式。3.8 Flash 是通用主力,Pro 和 Ultra 订阅用户、API、AI Studio 当天就能用,1M 上下文、64K 输出,推理强度可调。

官方的说法是,相比三周前的 3.7 Flash,软件工程、智能体任务和多步推理都有明显提升,而速度和价格维持不变。

3.8 Flash Cyber 只通过新开的 Fairwind 计划开放,面向政府、关键基础设施运营方和可信防御者,650 多家机构加入,包括 Snowflake、CrowdStrike、Datadog。

配的是 DeepMind 的 CodeMender 工具,主打漏洞发现加自动打补丁,把原本要几周的手工流程压到分钟级。

这套"同一权重、分层解锁"的打法,和前一天 Anthropic 的 Fable 5.1 / Mythos 5.1 一模一样。一天之内两家都这么干,它已经不是谁的创新,是行业默认动作。

图片

二、跑分要挑着看

Google 官方挂了 14 项对比。赢的那些很漂亮:Terminal-Bench 2.1 拿 89.4%,压过 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融分析 Vals Finance Agent v2 拿 61.4%,六个模型里最高。长视频理解 LVBench 87.8%,比 Opus 5 高出 12 个百分点。

长程软件工程 DeepSWE v1.1 拿 71.0%,对 Opus 5 的 74.0% 只差一个身位。而 3.7 Flash 在这项上是 65.3%,一个 Flash 级模型摸到超大杯的桌子,这是它最硬的一次跃升。

输的那些,官方正文里没提。

Terminal-Bench 4.0,3.8 Flash 只有 19.1%,Opus 5 是 51.8%,GPT-5.6 Sol 是 37.3%。

这不是差一点,是差一个量级。电脑操作 OSWorld 2.0 是 59.0% 对 75.4%。知识工作 GDPval-AA v2 是 1545 对 1824。

你注意到没有,赢的那项是 2.1,输的那项是 4.0。

同一个基准,Google 挑了对自己有利的旧版本。而且官方表里的 Anthropic 一侧只列了 Opus 5 和 Sonnet 5,没有 Fable 5.1,因为后者发布才一天,来不及放进对比。

第三方 Artificial Analysis 在 9 月 2 日做了独立复测,口径统一:智能指数 Gemini 3.8 Flash 59,GPT-5.6 Sol 61,Claude Fable 5.1 66。

三、真正的杀器是价格和速度

引入价每百万 token 输入 0.75 美元、输出 3.75 美元。对照 Fable 5.1 的 10 和 50,输入输出都便宜 13 倍。

再看每任务成本。Artificial Analysis 实测:Gemini 3.8 Flash 0.58 美元一单,GPT-5.6 Sol 0.95 美元,Claude Fable 5.1 3.69 美元。

跑完同一套评测,Fable 5.1 花了 8523 美元,Gemini 3.8 Flash 花了 826 美元。

速度差距更夸张。3.8 Flash 实测约 305 token/s,Fable 5.1 约 66,Opus 5 只有 56。

300 字的回复一秒出头。这是旗舰模型在物理上给不了的。

不过这笔账有两处要留心。头一个,引入价只到 2026 年 12 月 31 日,2027 年元旦起直接翻倍到 1.5 和 7.5 美元。

另一处是 Google 自己写在模型卡里的:模型会"更努力",在复杂任务上多跑几步推理、反复调工具。

结果就是单价没变,每任务成本比 3.7 Flash 涨了约 40%,输出 token 量多了三成,跑完一单也从 2.2 分钟拖到 2.5 分钟。

好在推理强度那个旋钮还在。低档每任务 0.24 美元、0.8 分钟,中档 0.41 美元,高档 0.58 美元。同一个模型三档价格三档智力,简单任务走低档、复杂任务走高档,是这次留给架构师的直接作业。

图片

四、Cyber 版和一张没人提的表

3.8 Flash Cyber 在 CyberGym(C/C++ 漏洞发现)拿 86.2%,是已公布的最好成绩,高于 GPT-5.5-Cyber 的 85.6% 和 Claude Mythos 5 的 83.8%。

比六周前的自家前代,涨了近 9 个百分点。

Google 内部用得很凶。Chrome 团队用它产出的正确补丁,是其他大型商用模型的 2.6 倍。云漏洞研究团队靠它在两小时内挖出一个关键基础漏洞,这类活人工通常要几个月。

但这次最被低估的是另一张表。Gray Swan 测的间接提示注入攻击成功率,数值越低越好:3.8 Flash 5.5%,Opus 5 是 4.8%,两家同属最强一档。

对照组呢?DeepSeek V4 Pro 60.1%,Kimi K3 52.7%,GPT-5.6 Luna 50.0%。差出一个数量级。

你打算给 Agent 接真实的业务权限,让它去读邮件、读网页、读文档,那么这一项比跑分更接近"能不能上线"的底线。

图片

五、回到那个问题

我的答案是,两场仗,赢了一场,输了一场。

"默认选项"这场仗,Google 赶上了,而且赢得很干净。快四到五倍,每任务便宜 6.4 倍,智能指数只差 2 到 7 分。客服、审单、内容审核这类每天跑成千上万次的活,"够用且便宜"本来就比"最强但贵"有说服力。

"最强模型"这场仗,还拉着。Terminal-Bench 4.0 的 19.1% 不是一次失手,它说的是另一件事:把模型扔进陌生环境做长链条规划和排障,它现在还撑不住。

真正说明问题的是资源投向。六周三款 Flash,Pro 系列同期一声不吭,此前传出要发的 Gemini 3.5 Pro 至今没影。

Google 好像已经不选了。它不去争那个"最强"的名头,它在争另一个位置:让你上新业务线选模型时,下意识就想到它。

文章标签GeminiGoogle模型发布应用落地安全
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多