Token导航 LogoToken导航TokenDH.com

小米公开直播MiMo-V2.6 RL训练!罗福莉披露进展:单步20亿Token

更新时间 2026-09-17来源 智猩猩正文 1287字阅读约 5分钟12 张图片
智猩猩AI整理
编辑:林夕

今天,MiMo负责人罗福莉公布了MiMo-V2.6的最新进展。

过去近半年,团队一直在围绕强化学习进行探索,目前这轮RL训练仍在进行中。

目前,MiMo-V2.6每个训练Step大约处理20亿Token,使用1568个Prompt,每个Prompt进行16次Rollout,整个过程采用异步运行。

图片

这一次,MiMo把训练规模继续往上推,同时扩展了Agent任务环境,并重新设计了评估和奖励计算方式。

MiMo-V2.6采用多任务Agentic RL,在同一轮训练中混合多个测试框架,让模型处理不同类型的Agent任务。

目前,小米已经上线MiMo-V2.6 RL实时训练页面,公开了Pro和Flash两条训练线,可以查看训练Step、Token、Rollout以及部分评测数据,页面数据也会随着训练持续更新。

公开的实时训练指标显示,MiMo-V2.6 Pro每个Step处理约 23.3亿Token,Flash每个Step约 26.9亿Token

图片

同时这轮RL训练的任务主要集中在编码场景,编码任务约占70%,视觉任务约占13%,一般任务约占12%,聊天强化学习仅占3%。

图片

训练过程中,MiMo还使用了Dynamic Sampler。公开页面显示,Pro和Flash分别对应独立的Dynamic Sampler训练任务。

图片

图片

从公开的数据可以看出,一个完整Step,Pro需要约 2小时31分钟,Flash约 2小时5分钟

图片

其中,Pro的outer_gen耗时约1小时27分钟,Flash约58分钟;trainer_ops分别约1小时和1小时3分钟。

图片

训练中的活跃环境数量达到数万级,Pro当前有 23,848个活跃环境,Flash达到 37,786个

图片

dynsam/agg_turn/mean显示,Pro为55.0,Flash为57.0,平均交互轮数达到50多轮。

图片

奖励数据也被实时记录在训练面板中。

目前Pro的critic/rewards/mean为 0.582,Flash为 0.564dynsam/avg@n分别为 0.609和 0.596

图片

dynsam/passrate/zero方面,Pro和Flash均为15.1%;

dynsam/passrate/one方面,Pro为24.8%,Flash为23.5%。

图片

任务变长也直接体现在上下文长度上,当前ctx_total_length/mean显示,Pro平均上下文长度约 93.1K Token,Flash约 107K Token

图片

任务完成后,奖励如何分配同样是训练中的一个关键问题。

MiMo团队这次加入了Agentic组内信用分配,并结合测试用例和基于量规的奖励,对模型产生的不同执行轨迹进行评估。

同一个任务可以产生多条Rollout轨迹,系统会根据任务最终结果、测试用例以及评分标准,对这些轨迹进行比较,再把结果反馈给RL训练。

目前页面上的数据仍处于实时变化状态,并不代表MiMo-V2.6最终版本的固定指标。

MiMo此次直接公开正在运行的RL训练页面,外界可以实时查看部分训练数据和评测结果。

未来几周,MiMo团队还会逐步公开这轮训练的更多细节。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多