小米 MiMo 大模型负责人罗福莉。图片由AI生成
文丨晓静
编辑丨徐青阳
“沉寂近半年后,我们一直在死磕一个问题:到底强化学习可以扩展到什么程度。”
9月17日凌晨,罗福莉在社交媒体X上公布小米MiMo-V2.6的训练细节,并随帖发布了两款模型的训练数据实时看板,向用户“直播”MiMo-V2.6-Pro和MiMo-V2.6-Flash的训练步数、Token消耗、任务通过率、评测成绩和累计费用。
官方说明,数据直接来自训练日志,且模型仍在训练,新系列即将推出。
按页面设定的费用速率计算,两轮训练合计每小时约3.08万美元。用户既能看到成绩上涨,也能看到分数回落、训练重启,以及GPU显存问题。

Jina AI创始人Han Xiao称赞公开训练流程的大胆与开放。“应该把这张动图发给CFO。”
01 罗福莉划重点
2025年12月17日,MiMo-V2-Flash上线后,罗福莉专门写了一篇技术说明,讨论混合滑动窗口注意力、多Token预测以及多教师在线策略蒸馏。
她解释,团队选择混合滑动窗口注意力,一方面考虑长上下文推理表现,另一方面考虑缓存与现有基础设施的适配。
谈到多Token预测时,她特别强调这项技术对高效强化学习的潜力:加快生成,有助于减少小批量训练中长尾样本带来的GPU等待。
当时,罗福莉就表示,受时间限制尚未把这项优化放进那轮强化学习训练。
关于后训练,MiMo-V2-Flash当时采用多教师在线策略蒸馏,将不同领域模型的能力整合到一个模型中。官方技术材料还介绍了大规模代码Agent训练环境,以及针对MoE训练、推理一致性的优化。
到今年4月,罗福莉把讨论推进到了Agent的运行方式与商业成本。
4月6日,在一篇长帖中,罗福莉分析了第三方Harness的资源消耗。她认为,低价值工具调用和反复携带长上下文,会推高成本;单纯压低Token售价,无法解决用户花了钱却仍然完不成任务的问题,因而主张让更节省Token的Harness与更强、更高效的模型共同演进。
这也解释了小米随后对代码工具的投入。
6月11日,罗福莉宣布开源MiMo Code,并表示,模型演进需要可靠的Harness,Harness也需要模型能力支撑。她同时披露,最初的开发由5个人用14天完成。
从2025年12月到今年9月,按照时间线来看,能够一定程度的反映罗福莉的思路:先提高推理和后训练效率,再改进模型执行任务的框架,随后扩大多任务强化学习。
02 算力去哪了?
罗福莉披露,本轮MiMo-V2.6训练扩展了三个方向:计算规模、任务环境与Harness,以及评分器的计算投入。
具体包括:每步训练约涉及20亿Token,配置为1568个提示、每个提示16次尝试,采用全异步方式。按这个配置,一批包含25088条尝试轨迹。模型要在不同任务环境和执行框架中完成操作,再根据测试用例、评分标准等反馈进行学习。
MiMo-v2.6系列强化学习训练看板
这些设置把训练难点从答案生成,扩展到了完整的任务过程。
例如,模型修改一段代码后,需要运行测试、读取报错、继续修改。训练系统既要支持这些操作,也要判断修改是否有效。如果环境启动失败,算力消耗可能无法换回有用的样本;如果评分方式有漏洞,模型获得的高分也可能偏离真实需求。
因此,训练成本包含大量生成、工具执行和结果验证,模型参数更新只是整个过程中的一部分。
罗福莉公开的看板中,能看到各种各样的工程问题。
页面展示环境运行数量、基础设施故障造成的样本损失,以及样本生成到进入训练之间相隔的模型版本数。在异步系统中,任务执行和模型更新并行推进,团队需要监测样本是否已经落后于当前模型。
小米还公开过一条故障通知:Pro训练因一个节点的显存问题而重启。这真实的反映了训练效率取决于模型算法,也取决于系统运行的稳定性。
X用户elie(@eliebakouch)特别关注看板公开的每批数据与Harness构成,以及大量内部训练指标。他认为这些信息能帮助研究者观察模型究竟在什么任务上学习、训练资源怎样分配。

03 起起落落的跑分
截至北京时间9月17日早间核查时,官方公布的DeepSWE v1.1代码评测结果中,Flash从第1步的48.67升至第12步的60.77;Pro从第1步的58.41升至第10步的63.72。页面标明,评测采用mini-swe-agent,口径为avg@3。
中间有明显波动。Flash第10步达到60.18,第11步降至54.13,第12步又回升。Pro前几步也多次下降。公开数据还不足以解释每次变化,但已经能看出,投入与成绩之间并非每一步都同步增长。
网友Zain看到看板后,兴奋地提到训练开始约一天,DeepSWE就到了60%左右。这样的评论反映了开发者对提升速度的关注;后续能否维持增幅,仍要继续观察。

看板首页的训练平均通过率,需要与DeepSWE评测分开看。官方对avg@n的定义,是计算每道采样任务在多次尝试中的成功比例,再对任务取平均。任务构成、难度和基础设施故障,都可能影响这个数字。
文章和社交平台上若只截取一条上涨曲线,很容易忽略这些条件。更有价值的判断,需要比较相同评测设置下的多个检查点,并等待最终模型在真实任务中的表现。
Pro和Flash同时公开训练,也让产品分工变得可观察。两轮运行采用相同的提示数量与尝试次数配置,页面设定的费用速率相差一倍。Flash的代码成绩已有提升,Pro在已展示的后续检查点上仍有更高分数。由于训练步数不同,现阶段不能直接得出严格的性价比排名。
但这组数据值得持续跟踪:更低成本的模型能覆盖多少复杂任务,更高成本的模型又能在哪些任务上拉开差距?答案会影响用户怎样选择模型,也会影响小米怎样定价。
04 降价的底层逻辑
罗福莉此前解释过MiMo API降价的逻辑,包括缓存优化、模型架构和推理系统效率。
据透露,滑动窗口注意力的分层KV缓存优化提高了缓存容量;混合注意力架构也降低了部分推理计算开销。
当时,罗福莉曾透露,降价后的生产推理服务接近满负荷运行,仍能基本实现收支平衡。
如果说之前的降价逻辑与技术和系统效率有关,那么这一次直播所反映的问题则是训练投入的回报。
按照小米MiMo官方接口设定的费用速率,每小时30834美元,两轮训练累计展示的费用约115万美元。不过,页面未完整说明硬件折旧、能源、人力等成本。这个数字可以用来观察本轮训练的投入尺度,无法代表完整的研发支出。
实际上,普通用户最终承担的成本,还包括推理调用、工具执行、失败重试和人工检查。这意味着训练阶段增加投入,只有在模型交付后提高成功率、缩短任务流程或减少人工接管,才可能转化为商业价值。
不同的产品和入口,不同的场景和用户需求都有所差异。开发者关注调用成本与稳定性,直接使用Agent的人更关心任务能否完成。
罗福莉历次发言反复涉及的推理效率、上下文管理、后训练和Harness,都与这些要求有关。
某种程度上可以把小米的技术站位概括为:面向Agent任务建设基础模型,并同时优化模型架构、训练系统和运行框架,让能力提升具备可承担的成本。
只不过,这条路线对团队提出了双重要求。
模型要在困难任务上继续提高成功率,系统也要减少无效生成、重复调用和资源等待。更强的模型若需要过长时间或过多重试,使用价值会受到限制;便宜的服务若无法可靠完成任务,同样难以留住用户。
公开训练看板增加了小米研发过程的透明度,也让这些要求更容易被检验。
接下来值得关注的,是相同评测条件下的持续进步、Pro与Flash的能力差距,以及最终API和Agent产品能否把训练收益交付给用户。
每小时3万美元最终换来什么,需要由模型上线后的任务完成质量和成本回答。







