Token导航 LogoToken导航

小米开源MiMo-V2.6系列 6天训练耗资347万美元

更新时间 2026-09-23来源 21世纪经济报道正文 1283字阅读约 5分钟

21世纪经济报道记者雷晨

9月22日,小米正式发布并开源MiMo-V2.6系列,包含全模态旗舰Pro与高效推理Flash,Pro超高速模式V2.6-Pro-Ultraspeed同步上线,MiMoDesktop桌面客户端正式版推出。

小米集团创始人雷军当日发布微博称,9月17日起公开直播MiMo-V2.6强化学习后训练过程,六天直播背后是近半年基础研究和工程试错;此次保持模型架构和参数规模不变,通过扩大RL训练规模,提升编程、智能体、设计、研究等任务能力,API定价不变。

据Artificial Analysis发布的综合智能指数,MiMo-V2.6-Pro获46分,列全球开源模型第一、国产模型第一,超过Kimi K3、Qwen3.8 Max,并首次支持文本、图片、视频、音频全模态,是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示,其实测单任务成本为0.13美元,首次进入0.1美元区间,API定价沿用V2.5,同等智能水平下价格仅为海外模型的1/20至1/60。

烧钱规模同样直观:RL后训练约6天,Flash成本约85万美元,Pro约262万美元,合计超347万美元,累计约75万条轨迹。长程软件工程评测中,Flash得分从48.8升至65.68,Pro得分从58.4升至72.57。

技术侧,小米采用大Batch与全异步架构,单次更新1568个样本,支持1M上下文训练,单步Token达3.5-3.7B;混合多Harness框架,为Long Horizon RL提供更精准奖励信号;冻结Router抑制漂移,并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。

能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案,吸附PFAS,将约一个月的研发周期缩短至2—3天,效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化,形成6000余行源码,全部通过内核核验,且此前未接受Lean专项后训练。Design Arena评测中,其设计能力接近Claude Opus 5与GPT-5.6 Sol。

开源力度是另一重点。小米除开放Pro和Flash权重外,还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练,11项评测全面提升:SWE-bench Verified得分从61.1升至66.2,MiMo Cyber Bench从31.3升至47.0,Terminal Bench 2.1从37.1升至52.8,MiMo Visual Coding从64.0升至72.4。

客观来看,这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练,不含前期研发与推理成本;0.13美元的单任务成本能否支撑商业闭环,开源能否转化为生态主导权,仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多