
👦🏻 作者: GaKi
🥷 编辑: Koji
🧑🎨 排版: NCon

大模型有了「斩杀线」。
这个词为什么流行了起来?——它最初用自游戏 《英雄联盟(LOL)》,大意是:血量低于某个阈值,会被对手直接斩杀掉。

AI 生成
放到大模型语境里,虽然有些幽默,但意思差不多:
过去半年,这条「斩杀线」的概念被反复提起,而且频率越来越高。因为站在线上的模型越来越多,被赶回线下的模型也越来越多。
今年 2 月,OpenRouter 上中国模型的调用量份额超过了美国模型;与此同时,OpenAI、Google、Anthropic 这些海外头部厂商开始密集推出平价产品线,轮番降价。
9 月 22 日,小米发布并开源新一代 MiMo-V2.6 系列。三款模型,智能水平接近前代的两倍,价格不变。
按照这个坐标,MiMo-V2.6 系列模型预计会形成一条新的智能与成本前沿的「斩杀线」,尤其是 V2.6-Pro 模型。现在,位于这条线之下的将是绝大多数开源模型。而在这条线之上的,可能仅剩下 GPT-6Astra、Fable5 等 5 款高端闭源旗舰模型了。
与同日发布的 Grok 4.7 相比,MiMo-V2.6 在智能指数上以 46 分与其持平,但单项任务成本只需要 0.13 美元。Grok 4.7 在高推理强度和极高推理强度下的单项任务成本则分别达到了 2.73 美元和 3.74 美元,大致为 MiMo-V2.6 的 21 倍和 29 倍。
也就是说,在智能水平相当的情况下,MiMo-V2.6 展现出了显著的成本效率优势,Grok 4.7 发布即在「智能—成本」维度落后。

🚥
接下来,我们想聊聊为什么偏偏是 2026 年下半年,效率成为了重点。
过去两年,基础模型的竞争几乎只有一条主线:更强的智能,让模型更 Smart。
但到了 2026 年,这套评价标准开始明显变化。
一个很直接的信号是,几乎所有头部模型厂商都开始在「智能—成本」上投入大量的资源。
这一方面可以简单视为「行业更卷了,除了卷智能还要卷成本」,但另一方面,这其实基础模型的阶段变化,顺应真实用户的体现。
今年 6 月以来,Google、OpenAI、Anthropic,以及国内的 GLM、Qwen、DeepSeek,都在持续调整模型分档和价格。
Google 快速迭代 Flash 产品线;OpenAI 把模型拆成 Sol、Terra、Luna 三档,其中 Luna 专门承接高频、低成本调用;Anthropic 也在继续压低 Sonnet、Opus 等模型的使用成本。

国内也一样,GLM、Qwen、DeepSeek 都开始频繁强调「效率」「成本」和「帕累托前沿」。
模型厂商关心的问题,转移到了模型的真实使用者所面临的问题:
这背后其实是 AI 的使用方式更加深入了,这可以被视为一个积极的转变。
过去大家用 Chatbot,一次调用通常只对应一个回答。现在进入 Agent 阶段,一项任务可能持续几个小时,读取文件、调用工具、修改代码、运行、检查,再不断重试。
一次任务背后,可能是几十次甚至上百次模型和 Tools 的调用。
所以,当 AI 真正进入 Workflow,独立开发者、B 端团队不得不开始计算成本消耗:
【1】任务最终能不能完成
【2】完成需要多长时间
【3】整个过程一共花多少钱

这时候,单次 Artificial Analysis 上的领先几分,已经很难完整代表一款模型在真实场景中的价值。
尤其是在 Agent 场景里,一个模型即使单次能力稍弱,只要速度更快、成本更低,可以允许 Agent 多规划几步、多调用几次工具、多尝试几轮,最后依然可能完成同一个任务。
反过来,一款模型即使能力很强,如果每次调用都足够昂贵,很多高频任务根本没有大规模运行的条件。
所以到了 2026 年,模型竞争正在增加一条越来越重要的新的坐标轴:
这也是这次很多人关注 MiMo-V2.6 系列模型的核心原因。

相比继续争论「谁是最 Smart的模型」这种没有太确切答案的问题,还不如去思考下如何利用 MiMo-V2.6-Pro 这样在性能和效率都取得不错成绩的模型,将其对应到真实的开发、办公任务中。
尤其当模型真正进入 Agent、Coding 和长时间任务之后,这种能力会直接决定一款模型到底能不能被高频使用。
在这个背景下,再来看小米 MiMo 过去一年做的事情,线索就很明显了。
从 2025 年底的 MiMo-V2-Flash,到 2026 年 3 月的 V2-Pro,到 4 月的 V2.5,再到 9 月 20 日发布的 V2.6,四次迭代,核心路线基本是「提高单位成本能够获得的智能」。
MiMo 的负责人罗福莉在 2025 年 12 月的首次公开演讲中,讲过三个关键判断,我们印象颇深。
第一,智能体之间需要一种高效的沟通语言,主要体现在代码能力和工具调用能力上。
第二,智能体之间的沟通带宽太低,需要围绕推理效率重新设计模型结构。
第三,大模型范式正在从预训练转向后训练。强化学习阶段需要更多算力,非常依赖一个稳定的、可扩展的后训练范式。
三个判断,如果简单地用一个词概括,那就是「效率」。
她当时展示的 MiMo-V2-Flash,这个模型的总参数 309B,激活参数只有约 15B。她说从参数规模看,她甚至不太愿意称它为一个大模型。
但在代码和 Agent 相关的公开评测中,它已经进入全球开源模型的第一梯队,和 DeepSeek-V3.2、Kimi-K2-Thinking 处于同一水平。

而这些模型的总参数,通常是它的 2 到 3 倍。
推理成本方面,V2-Flash 对比 DeepSeek-V3.2 成本略低,速度大致是 3 倍。对比 Gemini 2.5 Pro,速度接近,成本则只有约二十分之一。
这些数据背后有几项关键的技术路径,比如 Hybrid Attention、MTP 多词元预测、MOPD 多教师在线策略蒸馏等等。
这套方法围绕一个目标设计,让模型能被高频调用,能长时间运行,调用成本也能承受。
V2-Flash 之后,这条路线持续延伸。
2026 年 3 月,V2-Pro 发布,总参数超过 1 万亿,激活参数 42B,Hybrid Attention 混合比从 5:1 提高到 7:1,上下文窗口扩展到 100 万 token。发布前它以匿名代号「Hunter Alpha」上架 OpenRouter,测试期 token 用量突破 1 万亿,登上调用量榜首。

4 月,V2.5 发布,全量 MIT 协议开源。V2.5 维持了 Pro 级别的 Agent 性能,推理成本降了大约一半。发布后三个月,OpenRouter 调用量持续增长,7 月登顶全球调用量周榜和月榜第一。
OpenRouter 上大致有 400 多款模型,来自全球各家厂商。登顶调用量榜首,意味着全球开发者在有选择的情况下,用实际的调用行为选择了 MiMo。而且这个榜单在 6 月之后已经剔除了免费模型的扰动,是付费模型的调用榜。
现在到了 V2.6。

这一代产品组合是 3 款模型,对应 3 种不同的使用场景。我们做了一番整理:
【1】Flash,高智能、低成本的效率型模型,面向 Agent 和 Coding 的高频调用场景。
【2】Pro,面向复杂任务的高性能主力模型,处理复杂 Coding、长程 Agent、多模态理解和专业工作。
【3】Ultraspeed,超高速推理模型,推理输出速度最高达到 1000 TPS,面向实时交互和对响应速度敏感的生产场景。
整体来看,智能水平相较于前代接近翻倍,但价格在前两周内维持 V2.5 系列定价不变,之后可能会有调整。模型支持文本、图像、视频和音频全模态输入,重点增强了 Coding、Agent、Design、Research 与网络安全能力。
举个直观的例子,从实际使用上来看,MiMo-V2.6 系列模型在 3D 开放世界游戏、Blender 3D 建模等「Vibe Coding,甚至是 Vibe Wording」上都表现出来很好的效果:

其中,多模态能力是这次 MiMo-V2.6 系列模型比较受关注的一个方面。现在,这个模型已经可以直接参考特定网站和录屏内容,直接复刻创意工作室官网的页面和核心交互:

这些案例其实也侧面反应了 MiMo-V2.6 系列模型在设计方面的审美能力,比如前端网页、Figma、PPT、SVG、视频、音乐等等。
在设计评测榜单 Design Arena 上,MiMo-V2.6-Pro 已经获得了与 Claude Opus5、GPT-5.6-Sol 相近的水平。
在科研方面,MiMo 团队放出了一个案例:MiMo-V2.6-Pro 协助研究员,在 Lean 4 中实现了 Li–Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化。

成本定价方面,MiMo-V2.6 系列模型价格可以说下降到了一个新的程度:

如果把这些数据、智能水平以及成本放进「智能—成本」的坐标系里,V2.6 预计会把前沿线再往外延展一段距离。
这样的话,原有成本区间内的同档模型将会面临一个问题:要么提升能力,要么调整价格。
9 月 17 日,罗福莉在 X 平台直播了 V2.6 的训练过程。Pro 和 Flash 两个版本同步训练,累计训练成本超过 347 万美元,每小时消耗超过 20 万元人民币。
3 个方面在同步扩展:计算资源(每步约 20 亿 token)、环境和测试框架(多任务 Agent 强化学习)、评估计算。

她在直播中提到,接下来一年 AGI 进程最关键的方向是「自进化」,也就是在可验证的约束条件下让模型持续迭代优化。
从 V2 到 V2.6,MiMo 每一代基本都在用更少的激活参数、更低的推理成本,达到更高的智能水平。
这种效率提升来自持续的模型架构和工程优化。
回到开头的问题。效率在今天变得格外重要,原因是基模厂商已经进入了「规模化交付」阶段。
在这个相对成熟的阶段里,最大的融资、最高的关注度、最好的人才吸引力能够带来的注意力,开始边际递减。
在「规模化交付阶段」,模型需要被大量开发者实际调用,需要在真实的产品和工作流中长期运行。
尤其在 Agent 场景下,高频、长时间的 token 消耗是常态。

这个阶段,效率决定的是一个模型有没有资格被「默认选择」。
从市场结构来看,分层已经开始了。
首先,毋庸置疑的是最强的旗舰模型仍然会存在并且长期存在,它们处理最复杂的任务,服务愿意为顶级能力支付高额溢价的客户。
比如,Anthropic 的 Fable 5 定价每百万 Token 输出 50 美元比 Opus 5 贵一倍,用的人并没有因此变少。因为在最难、最复杂的任务上,它的能力确实不可替代。不可替代的东西,溢价的多少,并不影响客户心智。

其次,极便宜的小模型也会存在。分类、提取、路由这些简单任务,小模型快速、低成本,足够承担。
最后,真正被压缩的是两类模型之间的中间区域。这些比 Flash 模型强一些、但贵几十倍的模型,面临的局面将会越来越困难。
简单来说,它们的能力优势不够大,价格劣势却很大。过去开发者不太计较成本,现在 Agent 时代,面对如此高的 Token 消耗量,独立开发者、小型团队,以及为员工开通 Coding Plan 的公司,都不得不去「精打细算」一番。
这意味着未来的大模型市场,竞争可能会集中在两端:最前沿的能力端和最高效的效率端。
对于效率端的竞争者来说,关键指标是「帕累托前沿」上的位置。处于前沿上的模型,意味着在同等成本下没有人比它更智能,或者在同等智能下没有人比它更便宜。

这个位置和心智一旦占住,开发者的默认选择就会指向它。
MiMo 过去一年的路线,可以放在这个框架里理解。
V2 时期,MiMo 用远小于同级模型的激活参数,达到了相近的智能水平,在「智能—成本」坐标系上找到了自己的位置。V2.5 维持了这个位置并进一步提升,调用量登顶 OpenRouter 证明了开发者的实际选择。
V2.6 预计会把这条线再往外延展。

罗福莉发布 X 推文,对 MiMo 系列模型期待很高,其中一句话我们觉得很值得 Mark:在一个智能越来越容易被复制的时代,我们依然选择走那条更难的路:持续自我改进,并最终走向 AGI。
这条路线最值得注意的地方是可持续性。
三代产品中,每一代的效率提升都来自模型架构和工程系统的改进。按照这个节奏,未来的模型迭代仍然有继续压低前沿线的空间。
所以,中国厂商「只会卷价格」,其实是一个伪命题,破题的核心在于「效率」。
对开发者而言,这件事的意义也就再简单不过了:更低的任务成本,意味着过去只是「技术上可行」的 Agent 应用和长程任务,现在开始变得「商业上可行」。
能启动的任务更多了,能承受的试错次数也更多了。
🚥
AI 大模型走到今天,虽然有越来越多的事情不确定(前沿模型是否会「越狱」、人类是否会面临安全问题、哪家厂商能一直做出最好的模型、Mythos 到底有多强等等),但有一件事越来越确定:
当一个便宜几十倍的模型已经能完成大多数任务,昂贵的 SOTA 模型必须反过来证明自己「人间值得」。







