
今年夏天,Flash突然从开发者嘴里的“低配版模型”变成了刚需。
一位大模型研究员告诉《白鲸实验室》,一个交互70轮左右的工作流,“现在用V4 Flash,几分钟就可以跑完。”
他已经很少会在工作中只使用一款最强的模型。“GPT6 Astra出来了尝个鲜,还有Agent第一次上手新模型架构时,要用旗舰版模型,等到了后面改代码、训练、反馈结果这个过程,基本Flash就够了。”这位研究员说,两者结合省时又省钱。
企业计算模型本地化部署的成本后,选择的倾向性更明显了。
“DeepSeek V4 Flash,百万token的成本基本在2块左右。做端侧模型,至少需要8张H卡,每个月大概8万成本,可以供20人使用,按照吞吐token2000t/s,每月产出大概50亿token。按照高峰定价,即便直接用DeepSeek的api,一个月也就是4.5万。”一位企业模型本地化部署的服务商表示,人均月支出不过几千元,远远低于使用最强模型的成本费用。
相比成本高昂的旗舰模型,越来越多的企业开始选择更便宜好用的Flash模型,尤其随着AI办公等应用赛道的火爆,普通用户群体开始使用Agent,更助推了这个趋势。
国产模型厂商也纷纷抢注这波商业化潮流。7月以来,DeepSeek、阿里和智谱密集把Flash模型推上牌桌,8月26日,智谱发布GLM-5.3-Flash,阿里随后推出Qwen3.8-Flash。
在大模型变小的叙事中,DeepSeek几乎是姿态最激进的。7月31日,DeepSeek发布V4 Flash,一个多月后又更新V4.1 Flash。根据官方信息,DeepSeek一度计划在9月14日后把V4 Pro的API请求直接路由至V4.1 Flash,理由是在其测试中,V4.1 Flash在性能、成本、速度和总用时等指标上都已经超过V4 Pro。
后来因为用户抗议,DeepSeek又改变计划,决定保留V4 Pro。“DeepSeek最先证明了Flash不只是便宜,Flash可以比Pro更适合Agent,DeepSeek大概是这一波真正吃到Flash模型红利的模型厂商了。”上述服务商表示,DeepSeek相当于再次教育了用户,日常需求根本不需要Pro。
过去Flash通常是旗舰模型下面的低价版本,是开发者偶尔使用的替代模型。而现在随着Agent大爆发,国产模型厂商各显神通,开始厮杀起来,场面已经远非“斩杀线”一词可以概括了。
01
第一个真正吃到Flash红利的模型厂商
这波Flash模型的红利,DeepSeek真正赚到了点子上。
今年4月,DeepSeek V4发布的同一时间,Claude Code快速成为开发者默认Harness,Coding成为大模型圈的年度热词。
DeepSeek V4直接同步推出了V4 Flash和V4 Pro,并明确针对Claude Code、OpenCode、OpenClaw、CodeBuddy等Agent框架做适配,同时支持Anthropic API。
彼时,Claude Code让Coding Agent第一次显得足够有用,也迅速放大了token消耗。过去用Chatbot写代码,一次调用通常只是让模型解释一段报错,但Claude Code可以主动读取代码库、检索文件、修改代码、执行测试,连续工作几十轮。
对于传统SaaS来说,每月100美元订阅费已经不算低,但在Anthropic,Coding plan被开发者买成了硬通货,200美元/月的Max套餐都不够用,用户要经常需要额外购买API。按照token收费后,重度消费每月更是冲高到上千美元。
令人血压上升的顶尖模型成本背后,也悄悄发生一些微妙的变化。今年5月,在海外开发者社群reddit上出现了一个热度很高的讨论,“如果DeepSeek V4 5美元就能做同样的Coding任务,为什么还要花100美元买Claude Code?”
评论区里,不少用户表达Claude Code是真的好用,Anthropic的Harness,包括上下文管理、工具调用、计划执行、Terminal交互让他们不想放弃的同时,他们也感慨需要一个Claude模型的替代品。
这种变化反映了市场一个重要窗口。或者说昂贵的Claude模型,反向验证了Flash模型加量不加价的价值。很明显,DeepSeek看到了这一机会。
5月reddit的讨论里,DeepSeek Flash模型还能力不够,被用户指出只能堆代码。到7、8月,方向变了。有用户表示“我不用(Claude Code)Pro,就用V4 Flash,虽然比不上Opus/Sonnet,但够用了。”
reddit的高赞帖是一名后端开发者发布的,他表示V4 Flash发布后,已经没有继续购买Claude和ChatGPT订阅的必要。

网友们甚至开始讨论,该给V4 Flash配什么Harness,Claude Code、OpenCode还是Pi。有人用更强模型负责Plan,再让V4 Flash执行整个计划。
也有人直接用V4 Pro解决核心问题,Flash跑子Agent任务,Flash已经不仅是省月费,在部分大型debug任务里,OpenAI的顶级模型GPT-6 Sol会出现上下文问题卡住,DeepSeek反而一次完成。
而Flash对模型厂商来说,也是一门比旗舰模型更好的生意。
超大模型随着参数、激活量继续增加,对HBM容量、显存带宽和GPU间互联的要求都会迅速上升。到了2T量级,H200和Blackwell之间,存在的不仅是单卡计算能力差异,还包括显存速度和卡间互联。
Flash模型对算力需求不高。从目前几款主流产品看,大量Flash模型将单次激活参数压在十几B附近,H100、H200乃至更老一代的集群就能承载。模型厂商不用为它购买最昂贵的芯片,还能继续消化现有集群。同时,单次调用计算量更低,还能靠大规模batch继续摊薄成本。
“以DeepSeek的Flash为例,百万token的成本在2块左右,能将API总调用费压到比企业自己部署还便宜一半,就是因为batch大。同时服务一万甚至十万用户,一个用户停止生成,另一个用户的请求马上可以补入,不同请求被拼进batch,同一批GPU有更高的利用率。”上述头部大模型研究员判断。
尽管目前还没有哪家模型厂商,把Pro、Flash两条产品线的毛利率分别公开。但是多位研究员告诉我们,Flash模型已经成为当前模型厂商毛利最高,且赚钱的产品。
智谱的财报数据也能部分佐证这一点。2026年智谱的半年报显示,智谱规模化使用国产芯片,单位Token推理成本较年初下降80%。其中glm-5.3 Flash第一次实现超大规模在国产芯片上跑,实现了模型优化系统,系统承载模型的循环。Flash通过压缩激活参数,适配国产芯片,同步实现推理成本的降低。这也让智谱2026年上半年API收入达8.25亿元,同比增长2736%,毛利率由负转正至24.6%。
02
Flash发布各有节奏
DeepSeek在Flash模型上的成功,也让各家模型厂商被迫应战。
比如早早押注Coding的智谱。DeepSeek不仅打掉了Claude Code的Coding plan的溢价空间,作为国内最坚定走Anthropic来时路之一的模型厂商,智谱的高价Coding也更早进入Flash模型的射程。
智谱做Flash的方向也颇为明确。GLM-5.3-Flash总参数320B、激活18B,智谱称其价格约为GLM-5.3的十分之一,并且从架构开始就围绕长上下文、Agent、Coding和高效推理进行优化。智谱的Flash模型,始终围绕着Coding战场。
同时,智谱做Flash的心态也颇为矛盾。GLM-5.3 Flash越成功,能让智谱从Claude、OpenAI那里分蛋糕,但也让智谱的Coding模型陷入价格战的泥潭。
公开市场上,GLM-5.3-Flash、DeepSeek V4 Flash、Qwen3.8-Flash在相近的价格带里被频繁横向比较,不同第三方API甚至直接建议开发者同时接入多个模型,根据任务自动路由。
而这已经不是做国模Coding第一就可以解决的问题了。DeepSeek如同一个“价格屠夫”站在智谱身后,它让六个月前需要旗舰模型完成的任务,半年后Flash也能做,以至于前沿能力不断贬值,过去只有高价API才能买到的能力,最终降到几块钱一百万token。这恰恰是智谱不愿意看到的。
另一方面,如果只看能力储备,阿里可能是最适合卷小模型的公司。事实上,尽管阿里有最多的小模型,却没有一颗做出“爆款Flash模型”的心。
作为开源大厂,Qwen长期以来就是国内尺寸最齐全的模型家族之一。从面向手机、PC、汽车和机器人等场景的小尺寸模型,到Flash、Plus、Max,再到今年不断扩大的旗舰模型,阿里一直致力于推出模型全家桶。
到了Qwen3.8-Flash,百万上下文、Function Calling、多模态和缓存已经成为标准配置,阿里云甚至在8月27日继续下调其API价格。
不过阿里云是一家云企业,客户需求更复杂,无论客户用什么模型它都能赚钱。客户用Flash,阿里云挣钱,客户发现Flash不够,切Qwen Max,阿里云仍然挣钱,就连企业想自己部署模型,需要GPU、存储、数据库、推理服务,都要回到阿里云。
所以,阿里做小参数模型,更多的是求全。0.6B有人需要,就做0.6B,几十B适合企业私有化,就提供几十B。Flash适合高并发Agent,就做Flash,旗舰模型仍然决定技术品牌,就继续把Max往上顶。不管怎么定档,阿里云都能收钱。
其他模型玩家,各有差异。
MiniMax最值得关注的是它把类似的成本逻辑做进了视频生成。7月发布的H3,2K视频API是$0.13/秒,768P是$0.08/秒,并成功切入了市场。在语言模型上,M2.7就有了类似操作,MiniMax将API分为标准版和高速版,不用Flash/Pro命名,但根据吞吐和优先级分档收费。
Kimi更有意思,它其实没有跟随Flash路线。9月11日,Kimi推出综合性能接近K3,价格要便宜的K2.8preview(根据第三方路由测试)。从某种程度上看,K2.8preview也可以看做往性价比路线的试探。
通过Kimi产品,也能看出Kimi开始强调日常任务上使用全面均衡的K2.8 preview。K3本身是2.8T总参数、1M上下文,属于旗舰模型,主打更强的综合能力。

不过从定价体系上看,K2.8 preview依然远远高于当前的Flash模型。 尽管Kimi未公布K2.8 preview的token价格,根据第三方路由测试的价格,K2.8 preview每百万输入token $1.00,每百万输出token $4.00,也比V4.1 Flash版本贵数倍。
很明显,刚刚因为K3在海外收获不错口碑的Kimi,想要战略更聚焦,重心放在更强模型的推进上。在商业化上,9月18日,K3官宣和亚马逊合作,开始海外云厂商收入参与分成。
虽然国内各家模型厂商开始都瞄准性价比路线的模型,但截至目前,模型厂商在Flash模型上节奏和侧重点,仍未统一。
03
靠Flash赚钱,越来越难
当Flash成为模型厂最赚钱的产品,大模型公司又陷入了新一轮的迷茫。
模型公司们不想参与,但又不得不参与。旗舰模型迭代快速,很难有一家模型公司可以凭借一款旗舰模型长期在市场保持优势。再加上Flash模型的冲击,旗舰模型或许会迎来历史上最快的“技术折旧”期。
过去,大模型公司最接近的标的是传统软件公司,按用户量或者token消耗来估值,但现在模型厂商都在讲token成本和效率,做得越来越像一门云生意。
OpenAI把同一代GPT-6拆成Astra、Sol和Luna,最高档和最低档之间,输出价格相差100倍。而且,OpenAI开始像云厂商按照服务等级收费。同一个模型不再只有一个价格,而是区分Standard、Batch、Flex和Fast mode。
甚至也不仅卖模型API了。9月10日,OpenAI推出Agents API,把Codex背后的Harness、上下文管理、工具调用、子Agent调度和长期运行环境直接作为云服务开放。
Anthropic也在主动压缩旗舰模型和中档模型之间的差距。9月22日发布的Claude Opus 5.5运行成本比上一代降低40%,它的API定价也降至每百万输入token 4美元、输出20美元,比上一代Opus低约20%。
传统的软件产品,能力越强,用户越依赖,企业应该越有能力保住定价权。但大模型似乎很难复制这条路径。
模型厂商们一边加速迭代新模型,一边不得不计较单位token成本,GPU效率,优化缓存命中率,这已经越来越接近云计算的经营逻辑。模型成为基础设施和商品,价格成为市场上的关键因素。
目前,率先抢到Flash红利的DeepSeek,已经不是价格最低的Flash模型。Qwen3.8-Flash国际版公开价格约为每百万输入token0.15美元、输出0.47美元,中国部分区域价格还更低。GLM-5.3-Flash公开定价也低于DeepSeek V4.1 Flash的峰值价格。
长期来看,这个价格还会继续下探。假设DeepSeek能做到$1/M 输出,阿里可以做到$0.2,下一家还能$0.1,大模型公司需要找到新的商业化标的。
短期来看,Flash模型至少会让模型公司的收入数据看起来好看。已经上市的智谱、MiniMax的市销率,仍然高于海外的Anthropic和OpenAI很多倍。即将上市的DeepSeek,以及在上市筹备的Kimi,都需要更丰厚的商业化收入,撑高公司估值。
文|马舒叶
编辑|刘培







