2026年9月,大模型圈上演了一场令人目不暇接的混战。Meta的Muse Spark 1.3以62分冲上Artificial Analysis榜单前列,将谷歌Gemini 3.8 Flash刚坐了四个小时的位子抢走;DeepSeek把Flash系列的闲时输入价压到每百万token两分钱;Kimi K3以2.8万亿参数的体量全面开源;智谱、阿里、月之暗面、DeepSeek四家国产厂商,各自拿着不同的榜单成绩宣称“第一”。热闹之下,一个更深层的结构性变化正在发生:模型越来越聪明,但“聪明”本身正在加速贬值。
9月榜单最大的意外来自Meta。过去两年,榜首位置基本在OpenAI和Anthropic之间轮转,Meta始终扮演追赶者角色。Muse Spark 1.3的登顶,某种程度上标志着Meta超级智能实验室的路线开始兑现——从4月到9月,五个月迭代四款模型,节奏密集得不像一家曾经被认为“AI掉队”的公司。
但比排名更值得关注的,是前十名中五款模型的上下文窗口突破了100万token。智谱GLM-5.3做到131万token,一本《红楼梦》塞进去还有大量余量。长上下文已经从一个“卖点”变成了“入场券” ——没有百万级窗口,连旗舰竞争的牌桌都上不了。
如果只看表面数字,9月的价格战似乎只有一个方向:降。DeepSeek Flash闲时输入价2分钱/百万token,输出价4元;GPT-5.6 Luna降价80%;GLM-5.3-Flash定价仅为旗舰版的十分之一。旗舰模型之间的输出价差拉大到了25倍甚至更多。
但同一时间,智谱将Coding Plan三档订阅价格上调了130%到261%,DeepSeek V4 Pro的正式版API价格也高于Flash系列数倍。这种“一面降价、一面涨价”的看似矛盾,其实是同一本账的两面:降价端用贴近边际成本的价格抢占token入口,扩大调用量;提价端用峰谷定价引导批量任务向低谷时段转移,摊薄单位算力成本。
更深层的逻辑,可以用一句话概括:智能通胀,token通缩。模型的能力在快速“通胀”——每一代都比上一代更强、更全面;但token的单价在剧烈“通缩”——同样的能力,今天买比三个月前便宜75%以上。这意味着厂商如果只靠“卖token”赚钱,利润空间会持续被压缩。定价权不再来自模型有多聪明,而来自推理成本的控制能力和生态黏性。
国产厂商在9月贡献了最热闹的叙事。阿里说Qwen3.8-Max人类盲测仅次于Claude;月之暗面说Kimi K3是全球最强开源;智谱说GLM系列在Code Arena代码榜排第一。三个“第一”,三个不同的评价维度,听着都对,但放在一起就成了一场罗生门。
第三方数据给出了更冷静的图景。在Arena盲测综合榜上,Kimi K3-Max位列第10,GLM-5.3-Max第17,Qwen3.8-Max第20,四家国产头部模型都稳稳站在第一梯队,但没有一家真正“碾压”另外三家。细分赛道上,差距反而更清晰:GLM-5.3-Flash首秀就杀入代码榜前十,ELO分数1535,超过绝大多数海外头部模型;Qwen3.8-Max-0902首次入榜即登顶前端开发榜;Kimi K3则以2.8万亿参数的开源体量和100万token上下文,在长文档和可私有化部署场景中占据了独特位置。
“第一”是营销词,“第一梯队”才是真实生态。 国产四强各有护城河,与其争论谁更强,不如看谁更适合特定的活儿。
这个转变可能是9月乱斗给企业用户最重要的启示。过去两年,很多团队的默认策略是“上旗舰”——预算允许就买最贵的,觉得这样最保险。但价格梯度拉开之后,这个策略正在失效。
一个实用的框架正在成型:先用便宜的Flash级模型跑通流程,跑不通再上旗舰。 DeepSeek-Flash和GLM-5.3-Flash的闲时输入价已经低到可以忽略不计,批量任务、高频摘要、日常问答这类场景完全够用。真正需要旗舰的场景反而更聚焦:复杂Agent工作流、长文档深度分析、高精度代码生成、不计成本追求最强能力的前沿探索。
有测算显示,同样一项典型任务,选用不同模型的成本差距接近60倍。但企业真正需要衡量的不是“每百万token多少钱”,而是成功成本——如果模型输出不稳定,需要反复调整和重复调用,低价token的综合成本未必划算。
9月几乎所有新模型的发布会上,Agent都是高频词。Muse Spark 1.3针对长周期智能体任务做了专门优化,工具调用次数减少20%,完成相同任务所需token减少25%。Kimi K3在长程编程任务中可以持续完成长时间工程,理解和处理大型代码库。GLM-5.3在Terminal Bench 3.0上的得分从上一代的4.6跃升至28.3。
这指向一个清晰的趋势:模型的评估标准正在从“答题能力”转向“干活能力” 。能不能在长线程中协作处理多个工作流、能不能在模糊指令下主动澄清、能不能在遇到障碍时请求帮助而不是硬编——这些Agent场景下的表现,正在成为下一代模型的核心竞争力。
对用户来说,这反而是最好的时代。两个月前还高攀不起的能力,现在以极低的边际成本就可以获得。但前提是,你得知道自己到底需要什么。








