智猩猩AI整理
编辑:金水
今天,小米 LLM-Core 团队公开了 MiMo-V2.6 系列技术报告,并同步开源了模型权重、RL 框架、多域任务环境与轻量蒸馏模型。

- 论文题目:
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
随着技术报告公开,这个模型的真正看点也逐渐清晰,1.02T 参数的 Pro 与 310B 参数的 Flash,两个 MoE 模型,已经把 Agent 能力推到了与 Claude Opus 5、GPT-5.6 同台竞争的位置。
报告的副标题很直白,Scaling Reinforcement Learning Towards Self-Improvement(把强化学习推向自我提升),一份把"RL scaling"写进标题的报告。
它的开篇逻辑是:递归自我提升(RSI)需要 agent 把模型和环境耦合起来,持续提供多步轨迹和反馈信号;
而要在基础模型上 scale RL,卡点在于两件事,模型架构得留出足够大的探索空间,以及 scale RL 需要一整套基础设施、环境与评分器的工程解法。
于是 MiMo-V2.6 的全部后训练改动,几乎都围绕这一个目标展开:把 RL 算力沿训练、环境、评分三个维度一起推上去。
最终的提升效果相当直接,在代码 Agent 基准 DeepSWE v1.1 上,Pro 经 RL 后从 58.4 爬到 72.6,Flash 从 48.7 爬到 65.7;
横向摆到前沿模型桌上,Pro 在 Terminal-Bench 2.1、AutomationBench、MiMo Visual Coding 上已经反超 Claude Opus 5。

01
模型架构:
hybrid-SWA MoE 主干
MiMo-V2.6 是一个全模态 MoE 模型,文本主干由重复的 hybrid block 堆叠而成,每个 block 里交替排布局部滑动窗口注意力(SWA)和全局注意力(GA),滑动窗口大小只有 128。

具体的体量不对称很夸张,Pro 共 70 层(60 层 SWA + 10 层 GA)、384 个专家每次激活 8 个、总参数 1.02T、激活 42B;
Flash 共 48 层、256 个专家激活 8 个、总参数 310B、激活 15B。视觉侧挂着 681M 的 MiMo-ViT,音频侧挂着 Audio Tokenizer(308M)与 Audio Patch Encoder(127M)。


支撑多模态与高效率的还有几块独立模块:
(1)MiMo-ViT 用 sink-augmented SWA 替代固定窗口注意力,让信息能跨窗口边界流动,缓解视觉碎片化;
(2)Audio Encoder 分两阶段,先用 Audio Tokenizer 把语音压成 20 个 RVQ 码本、再经开残差量化的 patch encoder,把音频序列率从 25Hz 降到 6.25Hz;
(3)Speculative Decoder 基于 DFlash 的块扩散设计,用 5 层稠密 FFN 的 drafter 单次前向预测 7 个后续 token,做并行校验加速解码。
报告称,这套 hybrid-SWA 主干在不牺牲长程理解的前提下大幅压低了长序列的计算与 KV 成本,也为后面"在环境里跑几百轮 rollout"留出了算力空间。
02
预训练与 mid-training:
为 RL 铺路
预训练语料横跨文本、视觉与音频。
文本来自网页、书籍、论文、代码与 STEM;视觉覆盖图像描述、定位、OCR、GUI、视频与视觉编程;音频按语音-文本交错、ASR、通用音频描述三类组织。
训练分两阶段,先在纯文本上打基础,再接自研 ViT 与音频编码器做全模态联合训练。上下文从 32K 一路扩到 256K,Flash 训了 48T token、Pro 训了 30T token。
真正为大规模 RL 铺路的是 mid-training。
这一阶段转成 agent-centric,用覆盖代码、通用、视觉、科研的真实 agent 轨迹把探索空间撑大,上下文进一步拉到 1M。两个关键改动:
(1)优化器从 AdamW 切到 Muown(Muon 的变体,带显式行范数控制),专门扛大 batch 训练下的数据效率,且全程无 loss spike;
(2)引入 MXFP4 量化感知训练(QAT),让模型提前适应低精度计算,RL 阶段直接沿用 FP32 主权重与 Muown 行状态初始化,稳住低精度训练。
03
Scaling RL:
沿三个维度堆算力
报告在 scaling 章节就有介绍,先做一轮很短的监督微调(SFT),之后就全力 scale RL,不再反复回炉,他们把这种哲学叫 "You Only RL Once"。
RL 算法本身沿用成熟的 GRPO,配合异步 partial rollout(staleness 为 4)和 prompt-mean 聚合;真正的创新,落在更细的评分信号和一整套支撑大规模 agentic RL 的基础设施上。
所有实质变化可以归到三个维度。
第一是训练算力。单次 run 横跨数千张 GPU,Pro 和 Flash 的 RL 后训练分别烧了 260 万和 90 万美元。
每个 step 用 1568 个 prompt、每组 16 条 rollout,等于每步跑出 2.5 万条序列、2.7B~~3.7B 个 token,单条序列约 11 万~~15 万 token,上下文最长到 1M。
第二是环境与 harness。任务覆盖代码(68%)、通用工具使用(12%)、美学设计(13%)、上下文遵循(3%)与网络安全(4%)五大域;
并刻意训练多种 mini-harness,逼模型学到可迁移的解题策略,而不是绑定某一种交互框架。
报告专门用 hack agent 反复试探环境、再用离线轨迹审计兜住奖励作弊,整个 RL 过程中确认作弊的轨迹占比始终压在 2% 以下。
第三是评分算力。这就是 MiMo 在报告里最硬的一块创新,群组智能评分(Groupwise Agentic Grading),不再只靠"测试过就 1 分、不过 0 分"的二元奖励:

(1)GRS(群组奖励合成,离线):收集多条 rollout 让 agent 对比学出"实现 rubrics"和"行为 rubrics",最终奖励是 `R = R测试 × S实现 × S行为`,同分之间也能按质量拉开差距;
(2)GAR(群组优势重分配,在线):在"有对有错"的组内横向比较,把正优势从低质量的解往高质量的解上重新分配;
(3)配套的长度惩罚与段落级行为惩罚,专门压住 RL 中 token 暴涨和格式/工具调用错误。
钱花在哪,报告也摊开讲了,以 Pro 为例,rollout 占 43.8%、训练 43.5%、grader 12.7%,光"让模型去环境里干活"和"真正更新模型"就吃掉近九成算力。
04
实验评估
把 MiMo-V2.6 摆到与前沿模型同一张桌子上,差距已经很小,但分布并不均匀,报告本身也承认了这一点。
在智能体方向,它确实追到了前沿:DeepSWE v1.1 拿到 71.9(Claude Opus 5 为 74.0、GPT-5.6 为 73.0);Terminal-Bench 2.1 为 89.9,已超过 Claude Opus 5 的 89.1;AutomationBench 53.1,超过 Claude Opus 5 的 50.3;


视觉侧 MiMo Visual Coding 72.3,同样超过 Claude Opus 5 的 70.0;网络安全侧 CyberGym 为 94.0、Flash 更到 95.1,竞品未披露成绩。
在 Reasoning 与 Agentic 共二十余项指标上,MiMo-V2.6 与 Claude Opus 5、GPT-5.6、Claude Fable 5 互有胜负。
相对上一代 MiMo-V2.5-Pro(DeepSWE 仅 19.0),这一代是断崖式跃升,且跨域普遍成立。
但短板也明确Terminal-Bench 4.0(Pro 34.9 vs 49.0)、ExploitBench(47.9 vs 70.0)、ExploitGym(17.8 vs 22.1)等"科学导向"或复杂利用类任务上,Claude Opus 5 仍明显领先。
报告也主动标注了架构改动带来的鲁棒性边界,MoE 在 RL 阶段若不冻结 router,会出现严重负载崩塌,专家负载变异系数(CV)从 0.78 涨到 2.0,峰值负载从 6 倍飙到 16 倍,冷门专家占比从 0.5% 涨到 22%;
小米因此冻结 router,三个指标全程平稳(CV≈0.7、峰值≈5.5 倍、冷专家≈1%)。
为保证训练-推理一致,他们还用 R3(Rollout Routing Replay)重放每条 token 在各 MoE 层选的专家,配合 top-p 候选集重放。
05
MOPD2、开源与自我提升之路
报告还用 MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation)把不同任务上训出的教师模型能力合流,覆盖那些难以设计可靠 RL 奖励的领域,例如长程游戏开发、科研、具身智能等。
对社区,小米开源了一整套 agentic RL 基座:轻量模型 MiMo-V2.6-Distill-Qwen-9B(在 Qwen3.5-9B 上用 MiMo 生成数据做 SFT,再走多 harness RL,在 21 项 harness 评测上全数超过原版)、多域带 verifier 的任务环境、端到端 RL 框架,以及可组合的 mini-harness。
在 9B 蒸馏模型上,RL 同样能在多种 harness 下稳定带来增益。
报告在结论里点明,MiMo-V2.6 真正拉开差距的,是针对长程 Agent 任务的大规模 RL 后训练,以及围绕"细粒度奖励、稳定路由"做出的一整套机制改造。
模型能力的天花板,已经越来越取决于后训练阶段对真实执行过程的学习,这条路正是它通向递归自我提升的起点。







