Gemini 3.5 Flash 这波,有点快得不正常。
有网友一直在测试Gemini 3.5 Flash 的速度。这一个新的Gemini并没有说能力很逆天,而是它的输出速度直接冲到了一个非常离谱的区间:有网友测到 900 tokens/s 左右,写代码场景甚至最高达到 1141 tokens/s。这个速度如果属实,就已经不是普通的小版本优化,而更像是 Google 在重新定义 Flash 模型的定位。
相关测试主要来自 Linux.do 等社区讨论,目前还不是 Google 官方发布信息,所以更准确地说,它仍然属于“疑似泄露/灰度实测”。
几组数据大概是这样:第一组首字延迟 6850ms,输出速度 934 tokens/s;第二组首字延迟 7486ms,输出速度 923 tokens/s;第三组首字延迟 4421ms,输出速度 577 tokens/s;第四组首字延迟 3630ms,输出速度 673 tokens/s。

写码的时候速度最快,最快可以有900+ tps。
从网友晒出的测试结果看,它这种超快速度的推理基本可以在不同任务中进行复现,这就说明了这个模型的速度确实很快。
更离谱的是写码场景,最高可以冲到 1141 tps,普通情况下也能稳定在 900 tps 上下。虽然这些测试来自网友实测,口径和标准化 API benchmark 不完全一致,但这个数字本身确实已经足够夸张。

可以拿现有 Gemini 3 Flash 做个参照。
Google 官方对 Gemini 3 Flash 的定位,本来就是 “frontier intelligence built for speed”,也就是在保持较强能力的同时,把速度、成本和可用性拉到更适合日常高频调用的水平。官方博客中提到,Gemini 3 Flash 相比 Gemini 2.5 Pro 更快,价格为每百万输入 token 0.5 美元、每百万输出 token 3 美元。
第三方 Artificial Analysis 对 Gemini 3 Flash 的测试里,输出速度大约是 164 tokens/s。如果拿这个速度做参照,那么网友测出来的 Gemini 3.5 Flash,已经不仅仅是“快一点”,而是直接快了好几倍。

更关键的是,网友还测了它的写码能力,发现这个模型其实已经达到可用的效果。
有人让它做一个类似 MC 的沙盒游戏,从截图看,页面里已经有了方块地形、角色视角、游戏界面和操作区域。

也有人让它生成天气卡片、网页 UI、交互式前端页面。



这个测试看似简单,其实很容易暴露模型水平:弱一点的模型,经常会把页面做成“元素堆叠”,能运行,但很丑;强一点的模型,才会有视觉层次、信息结构和产品感。Gemini 这条线本来就比较擅长前端视觉代码,Google DeepMind 对 Gemini 3 Flash 的介绍里,也强调它可以帮助用户更快把想法变成可视化、交互式的内容。

再来看看简单的写文章测试


和前代比基本没有退步,测了一下simplebench,稳定9/10,概率全对。
所以Flash这个模型如果速度暴涨,但代码质量、UI 审美和推理稳定性没有明显下降,那 Gemini 3.5 Flash很有可能是兼顾了速度和能力的模型,它可以真正进入 Agent 工作流的主力模型。
Flash这类模型,其实真的很适配目前的Agent进行调用。一般来说,AI 编程和普通聊天不一样。普通聊天慢一点还可以忍,但 Agent 要连续读代码、改文件、调用工具、跑测试、再修一轮。这里面每一步都要等待模型输出。模型越快,Agent 越像一个真实的工作流引擎;模型越慢,用户越容易失去耐心。也就是说,对 Agent 来说,速度不是锦上添花,而是核心体验的一部分。
这也是为什么 Flash 这条线越来越重要。
可能一提到 Flash,大众的第一反应可能是“便宜版”“快模型”“能力不如 Pro”。但如果 Gemini 3.5 Flash 真能做到接近 Pro 级别的代码和推理能力,同时速度比现有 Flash 再提升数倍,那它的定位就会发生变化。它不再只是 Pro 的低成本替代品,而是更适合高频调用、实时交互、多轮迭代和 Agent 执行的默认模型。
模型能力一般来说,新版本肯定会比之前要好,所有这一次Gemini 3.5 Flash在多个维度上比Gemini 3.1 pro要高,同时延续了Flash系列一贯的高速特性。
在Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)以及MCP Atlas(83.6%)等极具挑战性的编码和智能体基准测试中,均超越了Gemini 3.1 Pro版本,并在多模态理解领域表现卓越,CharXiv Reasoning测试得分达到84.2%。在每秒输出标记数方面,其速度达到其他前沿模型的四倍。

当然,这一次谷歌也在Agent上发力了,在配合更新后的 Antigravity 开发架构时,Gemini 3.5 Flash 能够通过部署多个协同工作的子代理(subagents),有效应对庞大且复杂的应用场景。在监督机制下,该模型不仅能够稳定执行多步骤的工作流程与程序编写任务,同时也能维持顶尖的性能水平。
初步测试Q1:总结内容,生成知识卡片网页
总结这个网页(https://blog.google/intl/zh-tw/products/explore-get-answers/gemini-3-5/#agentic-tasks),生成一个好看,精致的知识卡片网页内容
整体的效果还是很惊人的,它可以快速的对网页进行总结,然后把要点提取出来,最后生成的网页卡可以进行互动和点击

Q2:3D地球绘画
使用Three.js和JavaScript构建一个网页,创建一个基于数组的 3D 世界,展示我去过的地方。点击 3D 地球上的标记将触发缩放动画效果,并打开带有照片的详细旅行信息。
虽然可以进行简单交互,但是没有画出详细的地形出来

Q3:开发一个“微旅程”网站,每天推荐一张世界小众角落的照片+一段故事。
一下子就能够给我把网站给整出来了,而且还把对应的图片给展示出来

Q4:做一个简单又有趣的儿童编程学习网站
目前AI教育算是一个实实在在的应用场景,可以快速创建一个“编程学习”网站。

Q5:手工咖啡烘焙坊的网页设计
手工咖啡烘焙坊的网页设计。触感与手工美学。首屏区域采用分屏设计,展示咖啡豆和冒着热气咖啡杯的微距镜头。使用'纸张纹理'背景和手绘植物插图。字体混合使用复古粗衬线字体和现代简洁无衬线字体。配色方案:'烘焙棕褐色'、'奶油拿铁色'和'森林绿'。每款产品配有交互式风味轮廓图。有机、温暖、感官化.

页面完成度一般,而且很多内容都没有填写
版本命名的信号按照惯例,新一代 Gemini 如果只是小版本更新,可能会叫 Gemini 3.2。但这次谷歌直接把它命名为Gemini 3.5 Flash,这个命名本身就很有意思。
这一次直接叫3.5版本,那谷歌想传递的信号可能是,这是 Gemini 3 系列的一次阶段性重塑。不过目前必须强调,Google 官方 Gemini API 模型列表里还没有正式列出 Gemini 3.5 Flash,官方文档目前能看到的是 Gemini 3.1 Pro、Gemini 3 Flash、Gemini 3.1 Flash-Lite 等模型。
除了 Gemini 3.5 Flash,另一个值得关注的名字是 Gemini Spark。
从目前流出的信息看,Gemini Spark 更像是一个 always-on AI Agent,也就是 24 小时在线、能持续观察上下文、主动处理任务的智能体。它很有可能接管更长链路的任务:邮件、日程、网页、应用操作、多步骤流程等等。虽然这些信息目前仍以爆料和社区整理为主,但目前就Google来说,显然它 不只是想做一个更强的聊天机器人而已。

这就能解释为什么 Google 这次可能特别重视“快”。如果 Gemini 要进入代码 IDE、浏览器、Workspace、安卓系统、搜索和 Agent 平台,它就必须做到快速响应。因为 Agent 的本质不是单次问答,而是连续行动。每一次工具调用、每一次代码修改、每一次任务拆解,都需要模型快速给出下一步。速度越快,Agent 越像一个能干活的助手;速度越慢,Agent 越像一个需要用户反复等待的半成品。
所以我觉得,Gemini 3.5 Flash 的核心卖点集中在这三个有点上:
快、便宜、能干活。
这也是 Google 更现实的打法。
在 AI 编程这件事上,Google确实已经落后一大截了。而且目前大部分的开发者已经被 Claude Code、Codex、Cursor 抢走了。、对 Google 来说,这才是最尴尬的地方。所以它如果想重新杀回开发者市场,最有效的办法是先让用户在第一分钟就感受到差异:输出更快、前端更好看、代码能跑、多模态理解更顺、Agent 调用更便宜。
Google想把 Gemini 变成Agent 系统里的基础能力。如果说 OpenAI 的优势是模型迭代节奏和产品声量,Anthropic 的优势是 Claude Code 和开发者口碑,那么 Google 最有可能打出来的牌,就是平台、分发、多模态,以及极致速度。
如果这点成立,那 Gemini 3.5 Flash 就不是一次普通更新。它可能是 Google 把 Gemini 重新拉回 AI 主战场的一次信号。





