AI 自己写的训练框架,训出了 1B 量级最强模型
速度比英伟达 Megatron 还快 10%
小尺寸模型第一
超越 Megatron
手机可跑
面壁刚刚发布了 MiniCPM5-1B,成为 1B 参数量级里,性能最强的端侧文本大模型。

在 Artificial Analysis 智能指数(AA Intelligence Index)上,MiniCPM5-1B 拿到了 17.9 分,排在所有小尺寸模型里的第一位。
这次还有个特别之处是,MiniCPM5-1B 的 Base Model 版本,是用一个完全由 AI 编写的训练框架 ForgeTrain 训出来的。
而且,这个框架在英伟达 H100 上,跑得比英伟达自家的 Megatron 还快 10%。

AI 自己写的框架,训出了该尺寸的最强模型,速度还超过了英伟达自己。这也是面壁正在实践的一个重要方向:
性能方面,MiniCPM5-1B 在综合知识、数学推理、代码编程、逻辑推理、工具调用等维度上,全面超越了 Qwen3.5-0.8B、Qwen3-0.6B、LFM2.5-1.2B-Thinking 等同尺寸模型。

而且 MiniCPM5-1B 还打败了参数量翻倍的 Qwen3.5-2B(16.3 分),拿到了 Artificial Analysis 智能指数里小尺寸模型的第一,延续了小钢炮系列一贯的以小博大。
把智能指数和参数量放到同一张图里看,就更加直观:MiniCPM5-1B 落在左上角的「最佳象限」,体量最小、分数最高。

MiniCPM5-1B 再次刷新了模型的智能密度上限:仅以 1B 参数规模,在国际知名榜单 AA-Index 上超越了所有 2B 参数以下模型;相比 3 个月前发布的 Qwen3.5-2B,MiniCPM5-1B 不仅效果更优,参数量还减少了一半。
这进一步验证了面壁一直以来,持续观察到的密度定律:
推理效率方面,同等智能水平下,MiniCPM5-1B 消耗的输出 token 是最少的。

其他 benchmark 的详细成绩如下,覆盖了 GDPval-AA、Terminal-Bench Hard、SciCode、IFBench、GPQA Diamond 等 13 项评测:
← 左右滑动查看全部 →












端侧友好是小钢炮系列的老传统了,而这次 MiniCPM5-1B 的部署门槛更是低到了……几乎没有门槛:
CPU 能跑,浏览器里也一样能跑。用面壁之前发布的自研 CPU 推理框架 ArcLight,配合 MiniCPM5-1B 的 INT4 量化版,在随意一个浏览器里就能断网直接开始推理。
能力出色的 1B 模型也能驱动各种各样的应用,如每个人都能养的一只「桌宠」。面壁这次顺手做了个桌宠项目(基于 clawd-on-desk 二次开发),让 MiniCPM5-1B 变成一只住在你桌面上的 AI 小宠物。

1B 的体量,几乎是个硬件都能跑得动,做到了「每个人都能养得起」的小宠物。
部署和微调方面,模型推理支持 vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX 等主流框架;微调支持 LLaMA-Factory、ms-swift、unsloth、xtuner、TRL+PEFT。
面壁甚至还贴心提供了 Claude Code skills,可以扔给 cc 一键完成面壁模型的部署和微调。
MiniCPM5-1B 能在 1B 规模上打出如此出色的成绩,重点之一在于数据治理。
面壁设计了一套分级数据治理方案,将数据按质量从 L0 到 L4 分成五个等级,并逐级筛选和提炼。且不是简单地「数据越多越好」,每一级都有不同粒度的清洗、去重和合成策略。
这份核心数据集也在这次随模型一起开源了:Ultra-FineWeb-L3。

它以 MiniCPM4 训练用的万亿词元高质量数据 Ultra-FineWeb 为种子(L2 级精筛数据),在此基础上进行了多种风格和形式的合成与增强,形成了 MiniCPM5-1B 退火阶段的关键训练燃料。
对于做中文模型的团队来说,这批数据可谓是价值不菲。此外,数据治理的技术报告也一并公开了(见文末链接)。
那 MiniCPM5-1B 是怎么训出来的呢?
这就是另一个重头戏了:新模型的 Base Model 版本,在预训练阶段用的不是 Megatron,不是别的什么人写的框架,它叫做 ForgeTrain,一个完全由 AI 编写的训练框架。
用你可能更熟悉、且确实更加准确一些的话来说就是:
「生产级」,这三个字很是关键。

英伟达实验室之前发布过 VibeTensor(陈天奇、贾扬青等人参与),号称「首个完全由 AI 生成的深度学习系统」。
但它比 PyTorch 慢 1.7 到 6.2 倍,官方自己标注了「请勿用于生产环境」,本质上,还是个研究原型。
而 ForgeTrain,则在英伟达 H100 上跑出了比 Megatron 快 10% 的训练速度,精度完全对齐(人评和机评与原版模型一致),连续跑了好几天后,稳定地完成了模型训练。

整个编写过程中,人类其实完全没有介入。点击 start 之后……AI 自己写一两天,基于提前定好的验收标准,AI 确认通过后,人类便可直接拿去用了。
据说面壁内部,已经用同样的方法搞定了8B模型/华为昇腾的框架 MindSpeed、MOE 等更复杂的架构。而且这套技术的可复用性极高,扩展到更大模型可能就一两个月的事。
做出如此成绩的 ForgeTrain 的背后,是由一套被面壁称作 Forge Engineering 的编程范式支撑,即定制化软件编程范式。
听起来有些陌生,但思路上很简单:
传统训练框架如 Megatron,要同时支持千问、DeepSeek、MOE 等各种架构,全塞在一套框架里。像一部通用手机要满足所有人的需求,必然处处妥协、有所让步。
但如果,AI 写代码的成本趋近于零呢?
千问和 DeepSeek 的模型架构有不小差异,那就不用非得搞一套通用的,而是可以直接从零各写一份,再针对性地各自优化到极致。MiniCPM 也正是这样,从零写了一套。
所有代码都是为特定需求现场定制的。

打个比方,现在的通用框架像苹果手机,一个产品需要服务于所有人。而 Forge Engineering 的未来,则是乔布斯坐在你旁边,为你打造一台完全满足你个人需求的独特手机。
OpenAI 之前也提过一个类似的概念,叫 Harness Engineering,它也自动化了评判环节。但 Forge Engineering 则更进一步:代码都交给 AI,按需打造,用完即弃。同一套验收标准,换个场景、换个芯片,AI 就能锻出一份全新的实现。
关于 ForgeTrain 的开发过程,面壁公开了一套三步走的方法:
在 Claude Code 和 Codex 推出 /goal 功能之前,我就也经常这么玩了,不过我主要写写工程代码或是训个小尺寸模型,还真没想过用来搞一下更好的训练框架……
ForgeTrain 和 Forge Engineering 背后,其实是一个全新的研发范式:用 AI 来造 AI。
在我看来,这件事已经到了最为关键的时刻。

不论 scaling law 是否已经撞墙,或者算力、数据、电力中的哪一个快到了顶。但公式里还有一个变量没有被充分重视:研发周期。
AI 写代码的效率是人的 10 到 100 倍,把这个效率用在 AI 研发本身,研发周期就能从 18 个月压到 6 个月,甚至 1 个月、1 天。
为此,面壁还提出了一套 L1 到 L5 的分级体系,对标 OpenAI 对 AGI 的五级划分:

目前通用 AI 编程大概在 L3 的水平,但「用 AI 造 AI」这件事还落后一个身位,差不多在 L2 刚稳、L3 正要点火的阶段。
而 ForgeTrain 就是 L3 的一次实际落地。
另一边的御三家也都在往这个方向探索:Claude 一小时解出了人类自己都攻不下的开放数学问题;OpenAI 3 人小队靠 AI 写出了百万行生产级软件;DeepMind 让 AI 独立写出了博士级数学论文。
Anthropic 的 CEO Dario 甚至直接声称:自动化 AI 研究,是 AGI 时间表上最强的加速器。
对中国来说,这个方向可能尤其重要。高端芯片持续受限,中美加速卡的比例大约在 10:1,单靠堆算力根本走不通。
ForgeTrain 已经适配了华为昇腾,并且在华为昇腾上成功训出了 MiniCPM5-1B。
我们知道,英伟达真正的护城河,其实是 CUDA 的软件生态。老黄反复强调「英伟达本质上是一家软件公司」,这十多年积累下来的开发者生态、算法库和训练框架,让你一旦用上了英伟达,基本上就要离不开了。
而华为芯片在硬件上的进步虽然快,但软件生态一直是最大的短板。每个实验室、每个业务部都有自己的一套东西,用户连该用哪个都搞不清楚。
想在华为卡上办一件事,经常会这里缺一块、那里缺一块。

以前也不是没人想过解决这个问题。像 TVM 这类编译框架做了五到十年,并以「写一份代码,所有芯片都能跑」为目标。但现实则是,只做到了「能跑」,离「跑得好」还差得不少。
毕竟芯片种类和算法的组合实在太多了,一套通用方案要把每种组合都优化到位,还是非常有难度的。
而现在大模型给了一个新思路:既然 AI 写代码几乎不花什么成本了,那就不用再维护一个笨重的万能框架,而是索性直接为每款芯片、每个模型现场定制一份专属实现,性能上反而还能做到最优。

面壁的计划是:年内把大模型训练各环节(预训练、微调、强化学习、量化部署、推理)中不好用的软件,全部用 AI 重写。
拿到一个新模型,直接告诉系统要训什么,系统就帮你生成一套对应的框架。
可以说,能好好用上国产芯片这事,
ForgeTrain,可能就是第一步。







