
每一块钱成本,究竟能买到多少智能?
文丨申远
编辑丨刘梓元
9 月 22 日,OpenAI 和 Anthropic 前后脚发布了新模型。先是 Anthropic 的 Claude Opus 5.5 拿下 Artificial Analysis 智能指数第一,紧接着 OpenAI 发布 GPT-6 Sol 和 Luna,它们是旗舰 GPT-6 Astra 的中档和入门档版本。
其中更惹人注目的是价格。Claude Opus 5.5 比上一代降了两成,缓存读取价降了六成,OpenAI 的两款新模型在 GPT-5.6 价格的基础上再砍一半,官方的说法是 “成本减半,错误减半”。
几乎是同时,小米发布了预热许久的 MiMo V2.6 系列。其中 MiMo V2.6 Pro 的 AA 智能指数是 46 分,较前代接近翻倍,位列国产模型和开源模型双第一,价格则和四个月前一样,每百万 token 输入 3 元、输出 6 元。
二十四小时之内,三家公司的新模型都指向的是同一个方向:用更少的钱提供更多的智能。这条从初夏延续至今的大模型斩杀线叙事,迎来了新的节点。

把所有模型按智能水平和单位任务成本放到一张图上,连出最外面的一条线,落在线上的模型,要么在同样的价格下最聪明,要么在同样的智能下最便宜,这就是大模型的 “斩杀线”。经济学更喜欢用 “帕累托前沿” 来描述这种没有浪费的状态,在大模型的语境里,落在斩杀线内的模型从效率的角度看没有存在的理由,因为总有一个模型比它便宜,性能还比它强。
这个词借自游戏,血量低于某条线就会被一击处决。它之所以也适用于大模型市场,是因为换模型可以发生在一瞬间,很多时候只是把配置文件里的一个名字改掉,一个模型落到线内,就像游戏里血量掉到线下一样,会被一击毙命。

4 月 24 日 DeepSeek 放出 V4 预览版,Flash 版每百万 token 输入 1 元、输出 2 元,Pro 版上线次日打出 2.5 折,输入 3 元、输出 6 元,价格比当时国内所有模型都便宜一截,同时性能也足够使用,这是 “斩杀线” 这个词走向公众的开始。5 月 22 日,DeepSeek 宣布这个折扣永久保留,五天后,小米 MiMo-V2.5 把价格和它完全对齐,官方宣称最高降幅达 99%。
“斩杀线” 由两个变量决定,智能水平和单位成本,任何一边发生变化,线的位置就会移动。DeepSeek 自己就是最好的例子。
7 月底,DeepSeek V4 Flash 正式版上线,需求原地拉升,两周内仅 OpenCode 一家的日用量就从 3T token 抬升到 18T,粗略估算这可能是千卡级别的新增需求,OpenCode 一时找不到足够的渠道,于是用户端的体验肉眼可见地变差。8 月 17 日 DeepSeek 宣布涨价,V4 Pro 的输出价从 6 元涨到高峰时段 27 元,OpenCode 上的需求随即开始回落。
整个夏天的模型竞争分成两条线,一边是头部厂商接连推出刷新榜单的前沿模型,另一边,几乎所有厂商都加入了对斩杀线生态位的争夺,包括主打前沿模型的 OpenAI 与 Anthropic。作为在智能最前沿开出最贵账单的人,它们对市场的变化感受得最清楚。7 月 30 日,OpenAI 把 Luna 的价格降了 80%,技术报告的标题就叫 “推进成本-智能前沿”;8 月 10 日,Anthropic 把 Sonnet 5 的介绍价转成了永久价。
国产模型公司对价格反馈更敏锐。本月初,DeepSeek 的 V4.1 Flash 在能力超过 V4 Pro 的同时,输出价只有 4 元,此时距离 V4 Pro 正式上线只有一个月。更多的模型厂在奋力摸高的同时,也陆续推出具有性价比的轻量级模型。
斩杀线的积极进展,价格敏感是首要的诱因。
一年前,大多数人用模型的方式是对话,一次对话顶多消耗几千 token,价格是个可以忽略的参数,C 端产品甚至干脆免费。
而在 Coding 和 Agent 成为主流用法的今年,模型的作用不再是回答一个问题,而是接下一项项任务:读文件、调工具、跑测试,一条完整的任务轨迹动辄几十万 token,如果是多个 Agent 并行协作,还要再乘上一个系数。同样用模型,消耗量上了两个数量级。
价格从可以忽略的参数变成了必须精确计算的经济指标,这是斩杀线叙事在这个夏天火起来的最大原因。
用户的账本是最先反应过来的。春天还火热的 tokenmaxxing 快速熄火,因为成本蹿升的速度比模型能力给工作效果带来的提升快得多。Uber 只用了四个月就烧完了全年的 AI 预算,许多企业开始给 AI 账单设封顶额度,或者建立内部路由,让不同的模型处理不同难度的任务,以此降低成本。
后一种做法之所以可行,是因为轻量级模型的能力越来越强,而真实世界的任务难度分布并不均匀。分类抽取、改写摘要、检索问答、结构化输出、工具调用编排这类工作,用顶级模型处理是杀鸡用牛刀,成本上首先就算不过来账。罗福莉本人的估计是,85% 的效率提升场景不需要最顶尖的模型。
当价格成为越来越硬的约束,轻量级模型就越来越有吸引力。当然,最理想的状态是以轻量级模型的价格提供顶级智能。
进入新阶段的斩杀线我们从 Anthropic 和 OpenAI 的降价就能看出这种趋势。在 Agent 把 token 消耗量抬高两三个数量级之后,没有人能绕开效率和性价比这道题,但它们的努力程度可能还不够。
第一个真正做到用 Flash 价格提供前沿模型能力的,是小米刚刚发布的 MiMo V2.6 Pro。它的 AA 评分高达 46,API 调用价格和上一代维持不变,在 AA 测算的单任务成本里,MiMo V2.6 Pro 只有 0.13 美元;Opus 5.5 每个任务的花费和 Opus 5 持平,约 5.86 美元,是 MiMo V2.6 Pro 的 45 倍;大降价之后的 GPT-6 Sol 单任务成本 1.06 美元,依旧是 MiMo 的 8 倍。

准确地说,API 价格没变,单任务成本还是涨了。根据 AA 的测算,上一代 MiMo V2.5 Pro 的单任务成本只有 0.05 美元,不到 V2.6 Pro 的一半,不过,多出来的 token 让新模型每个任务想得更多、完成度更高,而 0.13 美元这个绝对水平放在海外模型旁边,仍然足够便宜。
真正比 MiMo 便宜的只有入门级的 GPT-6 Luna,但它只有 37 分,头部的国产模型性能都排在它前面。
小米把斩杀线推到了一个新的节点。这是第一次,用一个 Flash 档的价格,可以买到第一梯队的模型能力。
智能的价格下降是可以预见的。Epoch AI 的统计是,2023 年以来,达到同等性能所需的成本平均每个季度下降约 47%,这个速度是算力成本下降速度的 6 倍、锂电池的 18 倍、早期电力(截至 1973 年)的 54 倍。据《晚点》看到的一份研究报告,Anthropic 过去五个季度的 token 效率提升了 5 到 10 倍。
但降到小米这种程度仍然罕见。现在 AA 榜单上,智能指数超过 MiMo V2.6 Pro 的只剩六个闭源模型,它们完成同一任务的花费最少是 MiMo 的 8 倍,最多接近 60 倍,落在 “斩杀” 范围内的是全部开源模型,包括两天前刚发布、同样主打性价比的 Step 5 Preview,还有同日发布的闭源前沿模型 Grok 4.7。
用轻量级模型的价格提供顶级智能,不仅让斩杀线覆盖了整个坐标系,也几乎改变了游戏本身。最直接的影响是,前沿模型的价格锚点被挪了位置。
“斩杀线” 的叙事在夏天就已经火热,但当时大家默认它只针对轻量级模型,想要前沿智能,仍然要付一笔溢价,这也是 OpenAI 和 Anthropic 原本的定价锚点。小米的模型出来之后,这个默认不成立了。所有比它贵的模型,也就是被它 “斩落马下” 的模型,都要回答一个此前不需要回答的问题:多付的钱究竟买到了什么。
压力落到了所有竞争者身上。拿得出更好前沿模型的厂商,要努力地证明自己的溢价是值得的,证明自己不会在大部分任务上被性能同样不错的轻量级模型取代,而拿不出更好模型的厂商,似乎只有降价一条路走。
对开发者来说,这是好事。AI 成本每降一次,可以部署智能体的场景就会急剧增加,原本算不过来账的事,比如用智能体处理全部数据、读完所有日志辅助决策、在工作流里部署大规模智能体群,在商业上变得可行了。这是 AI 时代的杰文斯悖论:单价降下来,用量不会按比例减少,而是以更大的比例增长,因为过去被价格挡在门外的需求会一起涌进来。
作为斩杀线新标杆的小米做对了什么把斩杀线往外推不是一件容易的事,从各家的路线选择上,很能看出一家模型公司的思路。
DeepSeek 最为人称道的,除了原创性,还有出色的推理工程能力,V4 系列的部署效率被同行称作全球几乎没有对手,因此价格可以做到更低。OpenAI 和 Anthropic 是围绕售卖 API 构建商业模式的公司,降价的动作落在缓存和推理系统的优化上,GPT-6 的降价被归因于缓存和推理上的改进,Anthropic 降得最多的同样是缓存价格。
Kimi 和 Qwen 朝着更大参数规模的方向走,K3 的总参数接近 3 万亿,Qwen3.8-Max 也有 2.4 万亿了,大参数也确实带来了显而易见的能力提升。
智谱和小米则更多依靠强化学习。从 GLM-5 开始,智谱的基座模型没有变过(最新的 GLM-5.3 Flash 除外),仅靠强化学习,模型能力就已肉眼可见的速度突飞猛进,小米也是如此。MiMo 的 Pro 系列从 MiMo-V2 起就停在万亿参数这个量级,V2.6 与五个月前的 V2.5 共用同一个基座,参数规模、架构、甚至预训练数据全都一样,能力提升几乎完全来自后训练的强化学习。

半年前,罗福莉在唯一一次出镜专访里说过,总参数到了万亿量级、预训练的代差基本抹平之后,Agent 的后训练强化学习是最具确定性提升模型能力的方式。这半年 MiMo 做的就是这件事。小米的直播页面显示,V2.6 这一轮强化学习总共花了 347 万美元,六天时间把模型在 DeepSWE v1.1 上的性能指标从 58 提升到超过 72。
在所有做前沿模型的公司里,小米是唯一一家消费硬件公司,它的主业是手机、汽车和数以亿计的联网设备,模型对它与其说是要卖的商品,不如说是这些设备都要用的底座。这决定了小米对效率的追求比任何一家模型公司都更迫切,作为一家把效率写进商业模式的公司,选择强化学习这种兼具性价比和确定性的提升方式,是情理之中。
但每个人都知道强化学习有用,难的是在不改动底层架构、不牺牲推理性能的情况下让这条路一直走得通,这取决于模型架构设计之初有没有把效率考虑进去。
小米从第一代模型就是这么做的。罗福莉发布的第一个模型 MiMo-V2 把这个思路推到了架构层,从设计之初就把长上下文做到别人不愿意提供的便宜程度。
今年 ICML 上,罗福莉做了一场报告,题目叫《架构、训练、推理协同设计》,模型架构为大规模推理而设计,后训练则重复利用架构本身的特点,效率最大化发生在三者协同最佳的时刻。效率恰好是贯穿小米模型设计全过程的理念。
预训练上,MiMo 采用混合注意力方案,降低上下文缓存的存储量,提升推理侧效率。推理侧,小米把原本庞大的缓存改成按不同窗口分层放置,多轮对话的缓存容量因此提高了五倍,专家并行的设备减半,端到端吞吐反而涨了四成。这些基于效率的改进,第一个受益者就是小米自己的后训练流程,推理效率提高后,同样的预算能跑更多的强化学习轨迹,反过来推动模型能力的提高。
当行业竞争的重心从能力上限逐步转向效率,斩杀线成为模型厂商争夺的新标杆,小米走了十六个月的效率路线也随之进入价值兑现期:一头是模型能力在成本不变的前提下接近翻倍,另一头是开发者用真实调用量投了票。从 3 月初到 9 月中,MiMo 开放平台的日均 token 消耗增长超过 40 倍,注册用户超过 250 万,海外占比接近一半。MiMo-V2.5 在 OpenRouter 上的调用量两个月增长约 616%,7 月登顶全球调用量周榜和月榜。
大模型无限游戏的未来今年 4 月,Dylan Patel 在一档播客里算了一笔自己公司的账。SemiAnalysis 是硅谷颇负盛名的半导体研究机构,一年花在 Claude 上的钱是 700 万美元,作为对比,它的工资总额是 2500 万美元,也就是说 token 已经占到人力成本的四分之一以上,“照这个斜率走,年底会超过 100%”。一个月后,他们在文章里更新了数字,Claude 上的年支出到了 1095 万美元。
这是目前大模型商业模式迅猛发展的一个缩影,也是斩杀线叙事成立的根本原因。智能很难量化,目前只能以 token 这种非常片面的形式计价,当一个产品只有能力和价格两个维度,它必然会被放进一张坐标系,自然而然就会出现一条帕累托最优曲线。只要售卖 API 的商业模式不变,斩杀线就在,而竞争只会越来越激烈。
几乎所有的观点都认为,目前这轮人工智能繁荣至少还会持续相当长的一段时间。需求端,智能正在变得越来越廉价,而 AI 的渗透率还远远不足,据 Atreides Management 创始人 Gavin Baker 估计,全球高频付费的 AI 重度用户不到 1000 万,广义的知识工作者有 15 亿,潜力巨大。
供给端,芯片和内存的价格一路上行,大厂对 AI 基建的投入只增不减,模型迭代的速度也越来越快。8 月底,智谱在半年财报里给出了自己对帕累托前沿的定义,除了智能能力与价格,还有第三个变量叫迭代速度,意思是单点的性能领先不再是最重要的事,竞争的焦点转向谁能以更快的节奏、更低的成本把顶级模型推向市场。这对所有大模型玩家来说都是挑战。
大模型是一项耗费巨大的工程,一开始就想清楚模型的结构和后续的优化方向非常重要,这一点上小米已经展现出了优势。仅仅提供廉价智能只是价格层面的战术动作,但它背后从模型架构到推理再到强化学习的综合系统,能确保在一次次迭代中占据优势,这决定的是战略上的胜负。
前提是 API 商业模式和斩杀线叙事持续稳定。但实际上,它们也在受到某种程度的冲击。
今年 3 月,罗福莉解释 V2-Pro 为什么比 Flash 贵时说,进入后训练时代,定价不应该根据最终推理成本,而应该根据模型最终产生的价值。这句话背后是一个更大的争论:模型会不会变成新的大宗商品。
持这种看法的人不在少数,如果模型能力最终趋同,它显然会变成另一种价格低廉、只受供需关系影响的大宗商品。为了阻止这件事发生,转向按价值定价是合理的,但这一步非常难走,因为不同任务的价值很难衡量。倘若商业模式真的向按价值定价转移,对模型公司来说,定价权就变成一件更重要的事,而只有能控制成本的人才更接近定价权。换句话说,只有熬过斩杀线的玩家才有机会走出性价比竞赛,把同样的成本优势投向更大的商业模式。
另一个有意思的地方在于,尽管包括梁文锋在内的许多人都认为开源模型并不会冲击大模型 API 的商业模式,但有数据显示,超过八成的美国创业公司在用中国的开源模型跑业务。也就是说,只要用户愿意,完全可以自己部署开源模型,而不向模型方付费。现在已经能看到,越来越多的开源模型转向一种隐形的收费方式,也就是更严苛的开源协议,比如对销售额较大的商业公司单独分成。但只要模型权重可以免费下载、私有化部署,API 定价就一定会失去溢价空间。或许,斩杀线的未来来自生态的锁定,一个模型即使性能稍弱、价格稍高,如果它深度嵌入了企业的工具链、数据管道和权限管理体系,它在斩杀线上的生态位会比一个孤立的强模型低得多。
斩杀线本身或许也在分化,因为需求分层正在发生,高性能模型承接高价值的复杂任务,高性价比模型承接大规模的重复性任务。这意味着未来或许不存在一条统一的斩杀线,而是多条并行的斩杀线,旗舰赛道、中端赛道、端侧赛道,各有各的生死线。
当然,归根结底,斩杀线叙事是一个技术命题。创新是跳变实现的,不是一段连续的光谱,行业共识是单纯扩大参数规模的边际收益在递减,但强化学习也并非没有上限。DeepSeek 曾经靠架构创新做出极具性价比的模型震撼了世界,最终推动斩杀线发生戏剧性突变的,还得靠原始的创新。
这场无限游戏的尽头,一定会让试图一步登顶的人失败,而褒奖那些一次次证明自己的人。
题图来源:《极速车王》







