半年沉寂,小米MiMo团队直接甩出一手"钞能力"级公开课:把 V2.6 Pro(1T 参数、42B 激活)和 Flash(309B、15B 激活)两条强化学习训练曲线,实时挂在mimo.xiaomi.com/rl上任人围观。
这不是发几张 PPT 糊弄事,而是训练成本、token 消耗、批次配置、DeepSWE 基准分数全部放送。把 RL scaling 的第一手成本曲线和配置细节摆出来,相当于把"规模化到底值不值"这道行业公开题的原始素材直接甩给所有人验算。
后续几周还会陆续放训练细节,这波值得蹲蹲蹲。










