6天,2000多万,小米这场史无前例的「炼丹直播」终于尘埃落定。
过去这六天,小米把一场大模型强化学习训练搬进直播间,眼看着美元计价器一路狂跳。
如今,MiMo-V2.6的Pro和Flash双双跑完30个训练Step,最终账单定格在350万美元(约合人民币2344万元)。

钱烧完了,模型也冲上去了。
MiMo-V2.6-Pro,1.02万亿参数,420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一。
Hugging Face CEO也称赞说,「太棒了」。

并且在多数Agent评测中,Pro的成绩已经逼近Claude Opus 5和GPT-5.6 Sol。

罗福莉将其称为「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」。
还没完,更猛的还在后面,这位曾参与DeepSeek-R1研发的小米MiMo负责人直言:
在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的DeepSeek-R1。
这话分量有多重?看完MiMo-V2.6的训练细节就知道了。
2000多万烧完,开源模型冲进闭源前沿
聊技术之前,先带大家快速过一下这次直播的「收官战报」。
MiMo-V2.6-Pro跑完30个Step,用时5天3小时,花掉约260万美元;
Flash同样跑完30个Step,用时3天10小时,花掉约90万美元。
每个Step包含1568个Prompt,每道题让模型尝试16条不同路线,一轮就会产生超过2.5万条Rollout。
按技术报告单步2.7B~3.7B training tokens计算,Pro全程累计处理约81B~111B Tokens,相当于塞满超过8万个百万Token上下文窗口。

这么多Token和真金白银砸下去,效果也相当直接。
30个Step结束后,Flash的平均通过率相对提升25%,Pro相对提升12%。
整体上涨之外,更有说服力的变化出现在DeepSWE v1.1这项样本外测试上。
Pro从58.4分涨到72.57分,提升约14分;
Flash从48.7分涨到65.68分,提升约17分。
DeepSWE v1.1专门考察Coding Agent能不能在真实开源代码库中持续工作,OpenAI和Anthropic也已将其列为前沿模型发布时的重点评测项。
MiMo-V2.6的表现侧面说明,这轮RL不是在训练集上原地刷分,只跑30个Step,模型不仅持续变强,还把能力迁移到了没见过的软件工程任务上,样本效率和样本外泛化一定程度上经住了检验。
尤其是Flash,30个Step跑完花费仅为Pro的约三分之一,相对提升反而更大,堪称这次训练的「性价比选手」。

至于Pro,负责的则是冲击能力上限。
在Artificial Analysis Intelligence Index中,MiMo-V2.6-Pro拿到46分,成功登上全球开源王座。

部分Agent评测中,它也已经和头部闭源模型打得有来有回。
例如AutomationBench上,Pro拿到53.1分,超过Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分。
再结合其他评测来看,MiMo-V2.6-Pro在全球模型市场中的位置已经相当清晰:
冲进开源模型第一梯队,并在部分Agent任务上摸到了闭源前沿。
而且能力冲上去之后,价格并没有跟着涨。
MiMo-V2.6继续沿用V2.5的API定价,Pro输入/输出每百万Token约3元/6元,Flash约1元/2元。
横向一比更夸张,在同等智能水平下,Pro完成任务的成本仅为国际前沿模型的1/20至1/60。
按照Artificial Analysis的测算,MiMo-V2.6-Pro完成一项Intelligence Index任务,平均成本只有0.13美元(约合人民币0.9元)。
也就是说,小米第一次把45分以上前沿模型的单任务成本,打进了0.1美元量级(约合人民币0.67元)。
巧的是,同日发布的闭源模型Grok 4.7,在这项指数上同样拿到46分,但据Artificial Analysis实测,其xHigh版本完成一项任务平均需要3.74美元,约为MiMo-V2.6-Pro的29倍。
同步上线的MiMo-V2.6-UltraSpeed模式,最高速度还能达到约900 TPS。
成绩单晒完,小米紧接着又把开源清单摊开了,一看阵仗还真不小。
Pro和Flash模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架,以及可以自由组合的mini-harnesses,全部开放。
此外还有一个MiMo-V2.6-Distill-Qwen-9B,这是一个以Qwen3.5-9B为底座,使用MiMo生成的77.4B Token数据完成监督微调的模型。
小米开放的是SFT版本,主要也是想给社区提供一个更强的Agent RL起点。
总之这一波,模型、训练场、裁判和训练流水线,小米基本都给配齐了。
也难怪小米一开源,整个AI圈瞬间沸腾。
罗福莉本人的推文在短短几小时内获得几十万浏览,不少大V也火速下场转发评论。

Ai2后训练负责人Nathan Lambert直接表示:
真正懂开源模型的人,早就知道小米在用MiMo憋大招。
他尤其点赞了「最高分开源模型+公开RL仪表盘」这个组合,直呼很有范儿。

Hugging Face前研究员Elie Bakouch关注的则是开源速度:
最夸张的是,他们在最终RL训练启动不到一周后,就交出了模型、技术报告、7000多个RL环境和完整训练框架。

AI研究者Himanshu Raj的评价更直接:
开源模型与闭源前沿之间的差距,又被大幅缩小了,而且这一次出手的还不是大家熟悉的中国玩家。

一片欢呼之外,有人迫不及待把视线进一步投向了「模型真正能做什么」。
超越Vibe Coding,MiMo直接Vibe World
模型刚训完,小米内部就把MiMo-V2.6-Pro扔进了一个极其刁钻的科研场景,让它设计新型MOF材料。
此前,MiMo-V2.6-Pro没有为科研场景做过一天的专项训练。
MOF,金属有机框架,2025年诺贝尔化学奖刚颁给了这个领域。通俗点说就是在分子尺度上搭建一种「多孔笼子」,可以精确地抓住特定的分子。
小米前沿材料团队用它来对付PFAS,这是一类全氟取代的有机物,PFAS进了水和土壤之后几乎不降解,被称为「永久性污染物」。

△PFOA(全氟辛酸,一种典型的PFAS类物质)结构示意图
拿MOF去抓PFAS,是材料科学领域一个公认的前沿难题。
MiMo-V2.6-Pro接到这个课题之后,先检索梳理了相关文献和专利,提出设计假设,然后自己核查方案的新颖性。
「大胆猜想」之后,MiMo便开始「小心求证」,它自动搭建好了模拟环境,并调用开源计算工具,计算它设计出来的MOF跟PFAS之间的结合强度。
它的思路是,在MOF内壁引入带正电的基团来吸引PFAS带负电的「头部」,同时嫁接更大、更扁平的芳香基团来容纳PFAS的含氟「尾巴」。
最终,模型跑出了两个候选结构,A50用的是芘基连接件,B50用的是三氟甲基联苯连接件,都是UiO-67型锆基框架。
模拟结果显示,A50和B50对PFAS的吸附性能是对照材料C50(联苯连接件)的一百万到一千万倍。

对此,北京大学材料科学与工程学院特聘研究员窦金虎教授评价说,MiMo-V2.6-Pro在这个项目上的表现,相当于一个训练有素的博士研究员。
小米方面披露,该系列已应用于公司内部新材料研发工作,整个研发周期从一个月压缩到了2到3天,效率提升十倍。
科研只是一个切面。
MiMo-V2.6这一代的能力,已经从「Vibe Coding」扩展到了「Vibe World」。
MiMo模型的能力边界,从写代码延伸到了更多场景,例如Blender 3D建模、视频创作、音乐生成,涉及各种不同的模态。
这也使得MiMo成为了开源Pro级模型当中鲜有的支持全模态的模型。
为了全面展示这些能力,小米团队用MiMo搭建了一个MiMo展览馆,里面的图像、视频、声音、3D模型等各种元素,全都是用MiMo生成的。

进入这座展览馆,映入眼帘的是一架钢琴,点击之后,钢琴就会开始自动演奏,演奏的音乐也是由MiMo创作,并且琴键也会匹配声音节奏进行运动。

从钢琴旁起身,就来到了左手边的卧室,卧室里有一台电脑,这台电脑是可以玩的。
它会不断地提示你密码,解锁之后便有游戏、PPT、终端CLI、视频等多个模块。

最有意思的是浏览器,点开之后它会自动进入这个画廊的页面,形成了套娃。
在套娃页面里可以再次进入这个「电脑」,这时再点击浏览器,就会发现MiMo团队留下的彩蛋。

走出卧室,就能看到墙上挂的画,这是MiMo在模仿梵高的《罗纳河上的星夜》,画对面的房间里,藏了一座城堡。
整个环境的3D建模和动画,也都由MiMo完成,水面波光粼粼地反射着城堡和摩天轮的倒影,天空中还有烟花不断绽放。

代码、图像、视频、3D、音乐,这些过去需要分别找不同工具的事,MiMo-V2.6一个模型就能理解和生成。
甚至在具身仿真环境里,MiMo还能通过视觉反馈闭环控制Franka Panda机械臂,做物体抓取和颜色分拣。
能力涨了、价格不变、速度还更快了,MiMo-V2.6-Pro站在了「智能-成本」的帕累托前沿上,打破了「智能、成本、速度」这组不可能三角。

除了模型本体,配合模型一起上线的还有MiMo Desktop桌面客户端,支持多个Agent协同工作。
我们试着用MiMo Desktop制作了一个「3D中式宇宙」,呈现出中式元素构成的虚拟世界。

MiMo先是设计了一个整体思路,然后把不同类型组件的构造任务分派给多个子Agent去完成。
这些组件之间相对独立,因此能够并行运行,相比串行省下了大量时间。
同时主Agent也没闲着,正在同步构建核心引擎和页面结构。

最终,它们各自的成果再由主Agent统筹整编,交付出了这样的作品:

可以看到,模型能够充分读懂prompt里的佛塔、悬空寺、宫阙水乡、各类中式建筑构件等大量东方元素,也可以理解「极其宏大、令人屏息的体素宇宙」的核心诉求,明白需要构建开阔大世界。
技术层面,MiMo也能够识别多视角查看、第一视角漫游、光效运动逻辑这类交互类要求。
总之,面对这份要素繁杂的需求,MiMo成功渲染了宏大梦幻的东方仙境,还原出了壮丽磅礴的体素古代中国。
从设计新材料到生成虚拟世界,从3D建模到控制机械臂……MiMo-V2.6展示了一个模型在不同领域、不同模态之间自如切换的通用性。
直播页面没讲的RL Scaling内幕
Demo看上去确实挺热闹,但真正硬核的还藏在技术报告里。
为了让这场超大规模RL顺利跑完,小米既要防模型「抄答案」,又得应付显卡爆显存、评分器失联、MoE专家负载崩塌等一连串意外。
罗福莉口中「不可错过」的技术报告,真就越挖越有~

后训练技巧大公开
最核心的当然还是MiMo-V2.6采用的后训练方法,小米把这次RL Scaling拆成了三个方向。
第一,扩大训练本身的计算量。
整个系统采用完全异步架构。
生成、执行、评分和训练可以同时推进,做完的任务直接进入下一环,不必等待整批任务全部结束。
这样一来,数万个Agent能够持续进入不同任务现场,边干活、边试错、边为模型积累经验,整条训练流水线也不会被少数慢任务拖住。
第二,扩大模型可以进入的训练环境。
这次训练把代码、通用Agent、视觉和网络安全任务混进同一次RL Run,模型既要修代码、操作工具,也要设计网页、复现漏洞。
而且,同一类任务还会搭配不同的Agent Harness。
如果模型只在一种工作台里训练,很容易记住特定操作套路,因此小米设计了多种可以自由组合的mini-harnesses,让模型学到能迁移到其他Agent框架中的能力。
实验中,即便换成训练时没有见过的Codex、Claude Code和mini-swe-agent,模型的平均通过率也从约50%涨到了66%。
第三,也是最容易被忽略的一点,即给「判卷」过程增加算力。
在MiMo-V2.6-Pro的训练成本中,训练模型占43.5%,生成Rollout占43.8%,剩下12.7%都花在了Grader上。
也就是说,这场价值260万美元的Pro训练,光给模型「判作业」,就花掉了约33万美元。

为什么判个分也这么贵?因为Agent任务不是选择题。
假设两条代码轨迹最后都通过了测试,一条只改了3行,准确解决问题,另一条改了几百行,还塞进大量兼容分支、异常吞噬和无关配置。
传统奖励可能会给它们同样的满分,但这两份答案显然不该获得同样的鼓励。
为此,小米设计了两套组内评分机制:
一套提前为任务生成「实现质量」和「解决过程」评分标准;
另一套则让评分Agent同时查看同一道题的多条成功与失败轨迹,再给通过测试的方案排出高低。
改动更准确、更精简、更符合原代码库习惯的轨迹,获得更多训练信号。
靠投机方式过测试的,奖励直接归零。
结果模型不只会把题做对,还开始学会用更短的路径、更少的Token,把事情做得更干净。
这也是小米所谓「自我改进闭环」的关键。
模型先生成多条路线,再由评分器找出其中更好的办法,最后把差异重新变成模型的学习信号。

△组内智能体评分机制
模型竟然会自己「偷答案」?
听起来确实顺,但模型很快找到了另一条「提升奖励」的捷径。
它开始抄答案了。
技术报告列出了不少真实案例:
有的模型会安装更新版本的软件包,直接查看里面已经修好的代码;有的会下载上游源码、克隆最新版仓库;还有的干脆搜索原始Issue、PR和历史Commit,照着人类开发者公开的答案修改。

△报告精选出的案例
测试确实通过了,但题不是自己做的,啊这……
为了堵住这些路,小米先清理训练环境中的补丁、构建日志、缓存和多余Git历史,再切断网络,防止模型去外面搜现成答案。
这还不够。
团队又专门派出一个Hack Agent,主动攻击训练环境,寻找可能泄漏答案的缓存、文件和工具漏洞。
Hack Agent找到一条,团队就堵一条,堵完之后再让它继续找,直到现有环境里再也找不到可利用的答案,才正式投入训练。
即便如此,团队仍在RL过程中持续审查轨迹,一旦发现新的作弊方式,就把对应奖励清零并继续修补环境。
最终,两款模型被确认存在Reward Hacking的轨迹,比例都被控制在2%以下。

△奖励作弊预防与监控机制
模型刚管住,硬件又出bug了
模型这边刚管住,硬件和基础设施又开始轮番出状况。
直播页面里出现过多次训练重启:
GPU显存双比特错误、Cyber任务集群Kubernetes故障、评分器网络失联、显存不足,以及长轨迹撑爆CPU内存。
其中一次Pro训练中,MoE专家并行中,某个EP rank收到的Token负载超过平均值的30倍,直接把GPU显存顶爆。
团队继续排查发现,RL会让负责分配Token的MoE Router不断漂移。
训练到第20步时,专家负载峰值已经从平均值的6倍涨到16倍,「冷专家」比例也从0.5%升至22%。
更微妙的是,把Router恢复到RL开始前的参数后,专家负载马上恢复正常,模型能力却没有下降。
于是小米用了一个相当直接的办法:
RL阶段,干脆把Router冻住。
△冻结Router防止MoE专家负载崩塌机制
至于一次性搬运数万条超长轨迹,小米还把控制平面与数据平面拆开:
调度系统只传轻量信息,Token、图像和路由数据等「大件」进入分布式存储,再由真正需要它们的训练节点读取。
各种长度不同、速度不同的任务,则交给Sample Mixer动态调度,避免简单任务早早跑完,复杂任务永远赶不上训练批次。
这些工程细节最终解决的是同一个问题:
当RL扩大到数千张GPU、数万个并行Agent和数十亿Token一步时,单纯「多买显卡」已经不够了。训练场、Agent工作台、评分系统、数据管道,以及防作弊机制,都得跟着一起扩大。
如果RL是通向模型自我改进(RSI)的路,那这条路在规模放大之后,会自己长出新的障碍。
模型学会抄答案,是它在「自我改进」的过程中找到了捷径,而不是真的变强;Router漂移导致专家坍缩,是模型的内部结构在高强度RL下开始失稳……
每一个障碍,都不是简单调参数能解决的,它们是RL走向更大规模时必须面对的结构性问题。
DeepSeek-R1走过一次这条路,MiMo-V2.6在规模和复杂度上又往前推了一步,也就意味着它撞上的问题更深。
但这些问题最终被一个一个啃了下来,Reward Hacking有Hack Agent对抗,Router漂移有冻结策略兜底,Grader成本控制在训练总成本的12.7%,说明大规模RL这条路是走得通的。
每解决一个问题,模型就离「通过RL持续变强」更近一步。
MiMo-V2.6,就是小米在RSI这条通向AGI的路上迈出的关键一步。
也是小米开创「直播大模型训练过程」背后,展现出的最核心的技术底气和硬实力。
开源地址:
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
博客:
https://mimo.xiaomi.com/mimo-v2-6
技术报告:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf







