Token导航 LogoToken导航TokenDH.com

离谱……面壁让 AI 写了个训练框架,然后它自己训出了最强的 1B 模型:MiniCPM5-1B

更新时间 2026-05-26来源 AGIHunt正文 4387字阅读约 14分钟26 张图片
AI 自我训练
MiniCPM5-1B

AI 自己写的训练框架,训出了 1B 量级最强模型
速度比英伟达 Megatron 还快 10%

17.9
AA 智能指数
小尺寸模型第一
+10%
训练速度
超越 Megatron
0.5GB
INT4 量化
手机可跑

面壁刚刚发布了 MiniCPM5-1B,成为 1B 参数量级里,性能最强的端侧文本大模型。

图片

在 Artificial Analysis 智能指数(AA Intelligence Index)上,MiniCPM5-1B 拿到了 17.9 分,排在所有小尺寸模型里的第一位。

这次还有个特别之处是,MiniCPM5-1B 的 Base Model 版本,是用一个完全由 AI 编写的训练框架 ForgeTrain 训出来的。

而且,这个框架在英伟达 H100 上,跑得比英伟达自家的 Megatron 还快 10%。

图片

AI 自己写的框架,训出了该尺寸的最强模型,速度还超过了英伟达自己。这也是面壁正在实践的一个重要方向:

用 AI 制造 AI。
MiniCPM5-1B

性能方面,MiniCPM5-1B 在综合知识、数学推理、代码编程、逻辑推理、工具调用等维度上,全面超越了 Qwen3.5-0.8B、Qwen3-0.6B、LFM2.5-1.2B-Thinking 等同尺寸模型。

图片

而且 MiniCPM5-1B 还打败了参数量翻倍的 Qwen3.5-2B(16.3 分),拿到了 Artificial Analysis 智能指数里小尺寸模型的第一,延续了小钢炮系列一贯的以小博大。

把智能指数和参数量放到同一张图里看,就更加直观:MiniCPM5-1B 落在左上角的「最佳象限」,体量最小、分数最高。

图片

MiniCPM5-1B 再次刷新了模型的智能密度上限:仅以 1B 参数规模,在国际知名榜单 AA-Index 上超越了所有 2B 参数以下模型;相比 3 个月前发布的 Qwen3.5-2B,MiniCPM5-1B 不仅效果更优,参数量还减少了一半。

这进一步验证了面壁一直以来,持续观察到的密度定律:

大模型的智能密度正在以约每 3.5 个月翻一番的速度持续提升。更小的模型,正在承载更高的智能密度。

推理效率方面,同等智能水平下,MiniCPM5-1B 消耗的输出 token 是最少的。

图片

其他 benchmark 的详细成绩如下,覆盖了 GDPval-AA、Terminal-Bench Hard、SciCode、IFBench、GPQA Diamond 等 13 项评测:

← 左右滑动查看全部 →

Benchmark 1
Benchmark 2
Benchmark 3
Benchmark 4
Benchmark 5
Benchmark 6
Benchmark 7
Benchmark 8
Benchmark 9
Benchmark 10
Benchmark 11
Benchmark 13

端侧友好是小钢炮系列的老传统了,而这次 MiniCPM5-1B 的部署门槛更是低到了……几乎没有门槛:

FP16权重约 2GB,适合 GPU 或高端笔电,零量化损失
INT8约 1GB,笔电和边缘盒子都能跑,几乎无损
INT4约 0.5GB,手机、平板、车机都行,几乎无损

CPU 能跑,浏览器里也一样能跑。用面壁之前发布的自研 CPU 推理框架 ArcLight,配合 MiniCPM5-1B 的 INT4 量化版,在随意一个浏览器里就能断网直接开始推理。

能力出色的 1B 模型也能驱动各种各样的应用,如每个人都能养的一只「桌宠」。面壁这次顺手做了个桌宠项目(基于 clawd-on-desk 二次开发),让 MiniCPM5-1B 变成一只住在你桌面上的 AI 小宠物。

图片

1B 的体量,几乎是个硬件都能跑得动,做到了「每个人都能养得起」的小宠物。

部署和微调方面,模型推理支持 vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX 等主流框架;微调支持 LLaMA-Factory、ms-swift、unsloth、xtuner、TRL+PEFT。

面壁甚至还贴心提供了 Claude Code skills,可以扔给 cc 一键完成面壁模型的部署和微调。

数据治理

MiniCPM5-1B 能在 1B 规模上打出如此出色的成绩,重点之一在于数据治理。

面壁设计了一套分级数据治理方案,将数据按质量从 L0 到 L4 分成五个等级,并逐级筛选和提炼。且不是简单地「数据越多越好」,每一级都有不同粒度的清洗、去重和合成策略。

这份核心数据集也在这次随模型一起开源了:Ultra-FineWeb-L3

图片

它以 MiniCPM4 训练用的万亿词元高质量数据 Ultra-FineWeb 为种子(L2 级精筛数据),在此基础上进行了多种风格和形式的合成与增强,形成了 MiniCPM5-1B 退火阶段的关键训练燃料。

Ultra-FineWeb-L3 数据规模
总量超过 1T Tokens
英文680B+ Tokens
中文410B+ Tokens,开源规模最大的中文预训练合成数据

对于做中文模型的团队来说,这批数据可谓是价值不菲。此外,数据治理的技术报告也一并公开了(见文末链接)。

ForgeTrain

那 MiniCPM5-1B 是怎么训出来的呢?

这就是另一个重头戏了:新模型的 Base Model 版本,在预训练阶段用的不是 Megatron,不是别的什么人写的框架,它叫做 ForgeTrain,一个完全由 AI 编写的训练框架。

用你可能更熟悉、且确实更加准确一些的话来说就是:

全球首个完全由 AI 编写生产级大模型训练框架。

「生产级」,这三个字很是关键。

图片

英伟达实验室之前发布过 VibeTensor(陈天奇、贾扬青等人参与),号称「首个完全由 AI 生成的深度学习系统」。

但它比 PyTorch 慢 1.7 到 6.2 倍,官方自己标注了「请勿用于生产环境」,本质上,还是个研究原型。

而 ForgeTrain,则在英伟达 H100 上跑出了比 Megatron 快 10% 的训练速度,精度完全对齐(人评和机评与原版模型一致),连续跑了好几天后,稳定地完成了模型训练。

比英伟达自家的框架还快,不只是「能用」,还是「更好用」。
图片

整个编写过程中,人类其实完全没有介入。点击 start 之后……AI 自己写一两天,基于提前定好的验收标准,AI 确认通过后,人类便可直接拿去用了。

据说面壁内部,已经用同样的方法搞定了8B模型/华为昇腾的框架 MindSpeed、MOE 等更复杂的架构。而且这套技术的可复用性极高,扩展到更大模型可能就一两个月的事。

Forge Engineering

做出如此成绩的 ForgeTrain 的背后,是由一套被面壁称作 Forge Engineering 的编程范式支撑,即定制化软件编程范式。

听起来有些陌生,但思路上很简单:

传统训练框架如 Megatron,要同时支持千问、DeepSeek、MOE 等各种架构,全塞在一套框架里。像一部通用手机要满足所有人的需求,必然处处妥协、有所让步。

但如果,AI 写代码的成本趋近于零呢?

千问和 DeepSeek 的模型架构有不小差异,那就不用非得搞一套通用的,而是可以直接从零各写一份,再针对性地各自优化到极致。MiniCPM 也正是这样,从零写了一套。

所有代码都是为特定需求现场定制的。

图片

打个比方,现在的通用框架像苹果手机,一个产品需要服务于所有人。而 Forge Engineering 的未来,则是乔布斯坐在你旁边,为你打造一台完全满足你个人需求的独特手机。

OpenAI 之前也提过一个类似的概念,叫 Harness Engineering,它也自动化了评判环节。但 Forge Engineering 则更进一步:代码都交给 AI,按需打造,用完即弃。同一套验收标准,换个场景、换个芯片,AI 就能锻出一份全新的实现。

关于 ForgeTrain 的开发过程,面壁公开了一套三步走的方法:

STEP 1
出考试大纲
先从 Megatron 这样的现有框架里采集关键数据,定好验收标准。
STEP 2
先确保及格
让 AI 在这套标准的约束下,写出一个和原版训练结果完全一致的框架。
STEP 3
从及格到超越
放开限制,让 AI 自由迭代优化,直到跑赢 Megatron。

在 Claude Code 和 Codex 推出 /goal 功能之前,我就也经常这么玩了,不过我主要写写工程代码或是训个小尺寸模型,还真没想过用来搞一下更好的训练框架……

用 AI 造 AI

ForgeTrain 和 Forge Engineering 背后,其实是一个全新的研发范式:用 AI 来造 AI。

在我看来,这件事已经到了最为关键的时刻。

图片

不论 scaling law 是否已经撞墙,或者算力、数据、电力中的哪一个快到了顶。但公式里还有一个变量没有被充分重视:研发周期

AI 写代码的效率是人的 10 到 100 倍,把这个效率用在 AI 研发本身,研发周期就能从 18 个月压到 6 个月,甚至 1 个月、1 天。

为此,面壁还提出了一套 L1 到 L5 的分级体系,对标 OpenAI 对 AGI 的五级划分:

图片
L1提建议(GitHub Copilot)
L2辅助研发(Claude Code、Codex、Cursor)
L3端到端闭环交付(ForgeTrain)
L4递归自改进,AI 改造 AI 自身
L5自主探索,AI 自己定研究方向

目前通用 AI 编程大概在 L3 的水平,但「用 AI 造 AI」这件事还落后一个身位,差不多在 L2 刚稳、L3 正要点火的阶段。

而 ForgeTrain 就是 L3 的一次实际落地。

另一边的御三家也都在往这个方向探索:Claude 一小时解出了人类自己都攻不下的开放数学问题;OpenAI 3 人小队靠 AI 写出了百万行生产级软件;DeepMind 让 AI 独立写出了博士级数学论文。

Anthropic 的 CEO Dario 甚至直接声称:自动化 AI 研究,是 AGI 时间表上最强的加速器。

对中国来说,这个方向可能尤其重要。高端芯片持续受限,中美加速卡的比例大约在 10:1,单靠堆算力根本走不通。

芯片数量没法变,那就提升每块芯片的研发效率。让 AI 自己来制造 AI,可能是目前最现实的路径。
国产适配

ForgeTrain 已经适配了华为昇腾,并且在华为昇腾上成功训出了 MiniCPM5-1B。

我们知道,英伟达真正的护城河,其实是 CUDA 的软件生态。老黄反复强调「英伟达本质上是一家软件公司」,这十多年积累下来的开发者生态、算法库和训练框架,让你一旦用上了英伟达,基本上就要离不开了。

而华为芯片在硬件上的进步虽然快,但软件生态一直是最大的短板。每个实验室、每个业务部都有自己的一套东西,用户连该用哪个都搞不清楚。

想在华为卡上办一件事,经常会这里缺一块、那里缺一块。

图片

以前也不是没人想过解决这个问题。像 TVM 这类编译框架做了五到十年,并以「写一份代码,所有芯片都能跑」为目标。但现实则是,只做到了「能跑」,离「跑得好」还差得不少。

毕竟芯片种类和算法的组合实在太多了,一套通用方案要把每种组合都优化到位,还是非常有难度的。

而现在大模型给了一个新思路:既然 AI 写代码几乎不花什么成本了,那就不用再维护一个笨重的万能框架,而是索性直接为每款芯片、每个模型现场定制一份专属实现,性能上反而还能做到最优。

图片

面壁的计划是:年内把大模型训练各环节(预训练、微调、强化学习、量化部署、推理)中不好用的软件,全部用 AI 重写。

拿到一个新模型,直接告诉系统要训什么,系统就帮你生成一套对应的框架。

可以说,能好好用上国产芯片这事,

ForgeTrain,可能就是第一步。

文章标签大模型算力
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多