AIPress(AI普瑞斯)
今天,AI 圈挺热闹。
小米MIMO、Grok、混元等都发了新模型,朋友圈阿里云栖大会也刷屏。
尤其是小米MIMO 2.6凌晨低调发布,一下子冲到了开源模型第一,价格比DeepSeek还低。
有个想法突然从脑子里蹦出来:
小米MIMO,越来越像Deepseek了。
说实话,看到 MIMO 2.6 的成绩,多少有点意外。
这半年,国产AI圈的关注点大多都在DeepSeek、智谱和Kimi上,几家轮流抢占开源榜单。
大家轮流成为“圣”,小米MIMO几乎没有太多消息。
小米MIMO上代模型还是4月份发布的,差不多都有半年了。在各家频繁更新模型的背景下,确实挺独特的。
这次MIMO 2.6的性能提升太大了,要知道 2.5 的Artificial Analysis 得分只有26分,2.6直接拉到了46分。
这啥概念,直接飙到了开源第一,压过 GLM-5.3 和 Kimi K3。排它前面都是Fable、GPT 6、GPT 5.6 Sol这种。

真有点当年DeepSeek R1那种感觉了。
R1 那会儿,别人还在卷参数和榜单话术,DeepSeek 把力气砸在后训练和强化学习(RL)上。
小米MIMO负责人罗福莉表示这半年把重心花在了RL上。
今天罗福莉专门发了长文解释这件事。
小米MIMO采用MixRL的训练策略,旨在解决大规模 RL 训练中的效率与工程问题。
具体做法是将可验证、难度适中的多个领域的任务混合在同一轮大规模强化学习中进行联合训练。这些任务包括代码生成、通用 Agent 任务、视觉任务以及网络安全等。
罗福莉解释,将这类任务放在一起训练,能够训练出泛化能力非常出色的模型。而对于那些难以验证、时间跨度极长或难度过高的任务(如游戏、3D 任务、依赖主观评价的任务),如果强行混入统一 RL 训练,会显著降低 rollout 效率或导致严重的采样数据滞后问题,因此被单独处理。
单独训练的任务最终通过MOPD方法将能力整合回主模型,与 MixRL 形成分工
罗福莉甚至把整个RL的训练过程都进行了直播。
整个直播历时 6 天,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 训练成本分别约 85 万与 262 万美元。
你能够看到它的DeepSWE v1.1 分别提升约 17 分(48.8 → 65.7)和约 14 分(58.4 → 72.6)。

这里有更完整的基准测试成绩。

说实话,直播训练过程这个方式真的很有科技感。罗福莉真把DeepSeek的那种精神带过来了。
罗福莉坦言在算力极缺的年代,团队几十号人还是把宝押在了RL这一条更慢的路上。
要知道给模型堆参数是更简单的方式,有同行模型参数都到了3万亿,MIMO 2.6刚破万亿。
DeepSeek开启了强化训练的浪潮,小米MIMO也在坚持走这条路。
罗福莉更在长文中承认,这项工作的研究创新和工程难度,超过了 DeepSeek R1,而 R1,她自己当年参与过。
再看价格,小米MIMO没有涨价,和其他国产模型一对比,直接成了性价比最高的一个。
MIMO 2.6 Pro要比DeepSeek Flash模型(高峰期)还便宜了。而且全是一口价,不分低峰高峰。
这下,直接可以受封“罗圣”了。


再来看“智能-成本”的帕累托前沿图(横轴成本、纵轴性能,前沿线上的点是“同样成本下性能最高,或同样性能下成本最低”的方案,线内的点都被支配)。
行业一般称为“斩杀线”。
MiMo 2.6 Pro 刷新了国产模型的性价比纪录,在同等智能水平下,价格仅为海外模型的1/20 至 1/60。

可以说,DeepSeek很长一段时间都在斩杀线上。
没想到,小米MIMO有一天也能实现这样的成绩。
有意思的是,罗福莉还提到了小米MIMO团队。她说团队足够扁平、没什么部门墙,大家都享受这种工作方式。
“来自不同领域的人每天聚在一起,受对 AGI 和能够持续自我改进的智能追求的驱动,来面对并解决各个领域的 RL 瓶颈。我将永远记住这一时期的 RL 每日更新会议。它们激烈而密集,智能在实时中涌现”。
而这似乎就是大家对DeepSeek的印象。
此外,小米MIMO还把这次技术成果及配套资源都开源,包括完整技术报告、训练环境与 RL代码,大家一起进步。
还有个有意思的点。
我突然发现,MIMO官网的互动和DeepSeek都很像……


这样理下来,更加觉得小米MIMO越来越像Deepseek了。
所以也能理解AI厂商花大价钱挖人才了,它是真能改天换命的。
在今天之前,我用的最多的就是DeepSeek,API也花了几百块钱了。
刚刚,我下载了MIMO Code,准备切过来试试。
不过,还是建议最好别轻易用UltraSpeed 超高速模式,虽然提供最高 20 倍的推理速度,但真的费钱呀。







