Token导航 LogoToken导航

小米MiMo-V2.6开源 开放智能体训练资源

更新时间 2026-09-23来源 AIGC开放社区正文 2147字阅读约 7分钟
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!
小米MiMo-V2.6系列发布并开源。

这次更新的重点,不只是模型规模变大,而是小米把更多训练算力投入到强化学习和复杂任务执行中。模型需要在任务环境里不断尝试、检查结果,再调整下一步行动。

MiMo-V2.6目前包括Pro和Flash两个原生全模态模型,同时提供面向实时交互的Pro UltraSpeed模式。

强化学习成为这次升级的主线

小米在发布说明中介绍,MiMo-V2.6进行了大规模、多任务强化学习训练,覆盖软件工程、通用推理、视觉任务和网络安全等方向。

整个Live RL训练过程持续约6天。Pro和Flash分别完成30步训练,累计使用约75万条轨迹。小米披露,Pro训练成本约262万美元,Flash约85万美元。

训练前后,模型在部分任务中的表现出现变化:

  • Flash的任务平均通过率提升约25%;

  • Pro的任务平均通过率提升约12%;

  • 在DeepSWE v1.1软件工程评测中,Flash从48.8分提升至65.7分;

  • Pro从58.4分提升至72.6分。

数据说明,MiMo-V2.6的训练重点放在了多轮操作和长程任务上。模型不只是生成一段代码,还要运行代码、发现问题,再继续修改。

Pro和Flash承担不同任务

MiMo-V2.6-Pro被定位为旗舰推理模型。小米称,Pro是万亿参数规模的全模态模型,面向复杂项目、长程任务、科研和网络安全等场景。

Flash则更偏向高频调用和规模化部署,重点平衡推理能力、响应速度与使用成本。

在开放平台和MiMo客户端中,小米还提供了Pro UltraSpeed模式,并称最高可实现20倍推理速度,主要服务实时交互和对响应时间敏感的应用。

从产品组合来看,Pro负责复杂任务,Flash负责高频任务,UltraSpeed则针对需要快速反馈的场景。三者共同构成了从深度推理到快速调用的产品梯度。

MiMo-V2.6系列API价格沿用V2.5系列,没有因为模型升级而同步上调。

模型开始处理可执行的复杂工作

MiMo-V2.6的能力展示,已经从文本问答延伸到3D建模、计算机操作和机器人控制。

在3D内容创作场景中,模型可以根据文字、图片或视频描述拆解任务,完成游戏场景搭建、交互逻辑编写和视觉验证。

在Blender中,它能够根据自然语言或参考图片生成三维物体和场景,输出可用于动画、游戏开发和3D打印的数字资产。

在具身智能仿真环境中,模型可以读取多视角摄像头画面,再通过视觉反馈控制机械臂完成抓取、颜色匹配和精准放置。

它还支持Computer Use Agent能力,可以理解图形界面,调用办公和生产力工具,完成资料检索、内容编辑和数据处理。

这些任务和普通聊天最大的区别,在于模型需要形成“观察—行动—检查—修正”的闭环。最终输出不再只是文字,而可能是一份文件、一段代码、一个网页,甚至一个可以交互的3D场景。

MiMo-V2.6进入科研辅助工作流

小米公布的案例中,MiMo-V2.6-Pro参与了材料设计和形式化数学证明。

在材料研究案例里,模型协助研究人员设计金属有机框架材料,并调用开源计算工具,对材料与PFAS之间的结合强度进行初步筛选。

在Lean 4形式化证明案例中,模型参与完成了一个数学定理的形式化工作,最终形成6000多行Lean代码,并通过Lean内核检查。

这类案例更适合被理解为“科研辅助流程展示”,而不是模型已经可以独立完成科研。它的价值在于,模型能够把文献整理、假设提出、代码执行和结果筛选串联起来,减少研究人员在重复性工作上的投入。

真正能否进入科研生产环境,还要看结果稳定性、专业审核和长期复现情况。

开源内容扩展到了训练过程

MiMo-V2.6此次开放的不只是模型权重。

小米同步公布了Pro和Flash的模型权重、技术报告,以及MiMo-V2.6-Distill-Qwen-9B和相关强化学习资源。

公开内容包括:

  • 7000多个强化学习任务环境;

  • 软件工程、漏洞复现、知识工作和网页开发等任务;

  • 环境交互、轨迹采集、奖励评估和策略优化工具;

  • 可组合的智能体Harness组件。

这让开发者可以研究模型如何训练,也可以尝试调整奖励机制和任务环境。

但开源并不意味着低成本复现。强化学习通常需要大量算力、任务环境和工程调试,模型权重能够下载,只是第一步。能否在不同硬件和任务上复现相近效果,才是开源项目后续影响力的关键。

小米在发布页援引Artificial Analysis Intelligence Index数据称,MiMo-V2.6-Pro取得46分,并超过部分开源模型。

MiMo-V2.6更值得关注的地方,是它把强化学习、智能体执行和开源训练资源放在了同一次发布中。

如果开发者能够复现其中的训练方法,并在代码开发、办公自动化、科研辅助和机器人控制等任务中持续使用,这次开源的价值会进一步放大。

MiMo-V2.6接下来真正要面对的,是开发者手里的真实任务:代码能不能跑通,智能体能不能稳定执行,训练资源能不能被社区复现。发布会上的演示只能说明它“能做到什么”,而实际使用会告诉我们,它能不能持续做到、低成本做到。

这也是MiMo-V2.6开源之后最值得看的部分。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多