Token导航 LogoToken导航

NaiveAI发布309B MoE模型Naive-N0.5-Flash

更新时间 2026-09-29来源 四木相对论正文 5196字阅读约 17分钟7 张图片

前几天,The Information 关于代季峰创业的消息,成功引起了我的注意。

报道提到,代季峰在今年2月创办了 NaiveAI。成立小半年,这家公司就完成了4亿美元融资,投资方包括腾讯、红杉、IDG资本。而且它做的是 LLM,这在如今的创业趋势中还挺不常见的。

没想到就在今天,Naive AI 的第一个模型 Naive-N0.5-Flash 迅速浮出水面。

我看了看,发现 Naive-N0.5-Flash 是一个 309B 的 MoE 模型,每次推理只激活 15.5B 参数,原生支持 1M tokens 上下文。

作为一款 Flash 模型,它采用了5层 SWA 搭配1层 DSA 的架构,也就是“5层看局部 + 1层搜全局”的混合注意力机制,资源效率很高。

它的模型权重和推理代码都以 MIT License 开放,将提供 API 访问。API 的输入、输出和缓存读取价格分别为每百万 tokens 0.6、2.6 和 0.07 元。

官方技术报告:https://mp.weixin.qq.com/s/bJaX9oXTGdf5BmO8tF1v1g

说实话,309B 的 MoE 架构模型,放到现在动辄上 T 参数的前沿模型里,肯定不算最炸的那个。

但我看完整个技术报告,却被震撼到了 —— Naive-N0.5-Flash 不仅 Coding 已经挤进国模第一梯队,AI For AI 的实践更是贯穿了整个模型的训练过程。

甚至,它还能帮人类研究员推进团队认知之外的项目。

这个 Flash 模型,某种程度上代表了现在 AI 领域最前沿的追求:模型自进化的进展。

一个擅长Coding和研发的模型

关于模型自进化,有种说法是,Coding 能力是实现自进化的前提。

这从过去两年,Coding Agent 的进化路径里能看清楚。

一开始大模型只能帮工程师补几行代码,后来,它能接 GitHub Issue,自己读代码、修改文件、运行测试。再往后,像 Claude Code、Codex 这样的 Agent 开始连续工作几个小时,自己调工具、看日志、修 Bug。

现在下一道边界已经出现了:

如果一个 Agent 已经能读代码、写代码、运行程序、观察结果并重新修改方案,那它为什么只能开发普通软件,而不能开发 AI 本身?

这件事落地的过程,就是所谓的 AI for AI —— 用 AI 迭代 AI。

目前,这个过程还需要人类研究员给模型布置任务、验收结果。但再往下一步,当模型可以自己找到下一个突破点,自己做实验,自己训练自己,就会实现 RSI。

图片

*A社的RSI进度参考

从 Naive-N0.5-Flash 的训练和评测结果里,这条 Coding 到 AI4AI,再到 RSI 的进化线索已经很明显。

先看 Coding。

在测评结果上,Naive-N0.5-Flash 的 Coding 能力已经进入国模第一梯队,尤其擅长长程、复杂的工程任务。

图片

在 SWE-Bench Pro 上,它拿到 68.8 分,排在 Opus-5.5 和 Opus-5 之后,超过了Qwen-3.8-Max、Hy4-Preview、GPT-5.6-Sol。

估计不少人知道,这个测试会直接丢给模型真实 GitHub 仓库里的软件工程问题,看它能不能读懂完整项目、定位问题、修改代码并把测试跑通。

还有 DeepSWE v1.1。

它主要测更长周期、更复杂的仓库级软件工程任务,更看重模型能不能在较长上下文里持续规划、跨文件修改、理解项目结构,并完成多步骤工程任务。

这一项里,Naive-N0.5-Flash 得分67.8,虽然排在它前面的国模还有 DeepSeek-V4.1-Flash,但依旧超了 Step-5-Preview、Kimi-K3、GLM-5.3 等模型。

NL2Repo 测的是通过一段自然语言需求,让模型从零搭出一个完整的代码仓库。

这一项里,Naive-N0.5-Flash 拿到 71.9 分,是图里最高的一个,超过 DeepSeek-V4.1-Flash 的 64.0,也高于 GLM-5.3、Hy4-Preview 和 Qwen-3.8-Max。

这说明,Naive-N0.5-Flash 不只是会修代码,也很擅长把一个抽象需求拆成完整工程,并持续把它做出来。

还有 Terminal-Bench 2.1。这个测试也很重要,会把待测试模型直接扔到开发环境里,让它执行 Bash、操作文件、安装依赖、调试程序等任务。

虽然这一项 Naive-N0.5-Flash 前面还有 DeepSeek-V4.1-Flash、GPT-5.6 Sol、Muse Spark、Kimi-K3、GLM 5.3 等模型,但这个评测大家咬得很紧,Naive-N0.5-Flash 跟排名第一的模型只相差了不到4分。

另外还有 ALE-CLI、ProgramBench等几项评测,不一一列举了。

总之,这些 Coding 测试的结果说明,Naive-N0.5-Flash 是一个能理解复杂系统,操作真实环境,连续执行多步任务,也能根据反馈不断修正方案的模型。

这正是模型参与模型研发之前,必须先跨过的一道槛。

Coding 之外,真正让我对这个模型另眼相看的,是 AI R&D 的测试结果。

AI R&D Bench 测的是模型做研发的能力。

换句话说,它不只是看模型会不会写代码,还看模型能不能帮人做模型训练、论文复现、机器学习实验和 GPU 优化。

这一步,基本就是 AI For AI。

图片

比如 PostTrainBench。这个测试会直接给模型一个固定的算力预算,让它自己去做语言模型后训练。

Naive-N0.5-Flash 的得分是 37.5,排在 GPT-5.6 Sol 和 GLM 5.3 后面,高于 Kimi-K3、Fable 5 和 Hy4-preview。

还有MLE-bench-30。这项测试让模型面对 Kaggle 一类机器学习任务,自己完成数据处理、建模、训练和优化,更像在考一个 AI 工程师。

这一项里,Naive-N0.5-Flash 拿到 73.7,高于 Sonnet-5 的 66.9% 和 Gemini-3.6-Flash 的 63.9%。

PaperBench 也很能说明问题。

它会给模型一篇机器学习论文,看模型能不能读懂论文,并真正把论文里的研究复现出来。这已经非常接近研究员的工作,而不是普通 Coding。

Naive-N0.5-Flash 在这一项得分 63.2,在官方这张测评结果里排第一,高于 Claude Opus 4.7 的 58.5、GPT-5.5 的 57.5、MiniMax M3 的 52.6 和 Gemini 3.1 Pro 的 46.7。

剩下还有优化 GPU Kernel,以及训练模型的测试,Naive-N0.5-Flash 的表现都蛮亮眼。

一个由AI深度“制造”的模型

为什么 Naive-N0.5-Flash 在 AI 研发上表现得尤其突出?

答案就在它的训练过程里。

官方披露,Naive-N0.5-Flash 在长达 3T tokens 的继续预训练中,重点强化了 AI 研发和编程能力。

其实,Naive-N0.5-Flash 本身就是这套 AI 研发方式的产物。

在它的研发过程中,很多重要工作都由研究员负责提出目标、设定约束、判断结果,AI 负责提出方案、运行实验和分析数据。

这套思路,从 Naive-N0.5-Flash 的架构设计,一直延续到模型的训练和 Infra 优化。

先说架构。

Naive-N0.5-Flash 基于开源模型 MiMo-V2.5 后训练而来,中间还有架构改造和 3T tokens 继续预训练。

但它没有完全沿用 MiMo-V2.5 的注意力结构,而是改成了每 5 层 SWA + 1 层 DSA 的混合注意力机制。

这个改动,本身就是一次 AI 参与模型设计的实践。

图片

修改注意力机制的原因是,MiMo-V2.5 原本有几层全局注意力,在处理 1M token 的超长上下文时会遇到效率瓶颈,上下文越长,计算和读取的压力就越大。

研究员为了改进这一点,给 AI 定义了一个明确的目标:模型必须继续支持 1M tokens 上下文,但计算耗时要下降,同时还要尽量保住模型质量。

AI 接受任务后,开始了循环实验。

它负责实现候选架构和训练方案、运行消融实验、比较不同方案并汇总结果,然后由研究员从满足目标的方案中作出选择。

最后,Naive-N0.5-Flash 采用了每 5 层 SWA + 1 层 DSA 的混合注意力结构。

架构确定下来后,问题还没有结束。

原来的全局注意力知道该关注哪里,但新加入的 DSA 索引器一开始却不会,这需要单独训练索引器,让它学会在找到真正重要的信息。

AI 继续深度参与了这个过程。它会自动检查索引器选出的结果,并与原来的全局注意力的结果做对比。发现问题后,AI 会自行修复再重新运行实验。如此循环,直到研究员判断可以正式切换到 DSA。

到了 1M tokens 训练阶段,AI 参与的优化就不只是模型结构,而是整个训练系统。

首先是两个不同注意力机制对于 GPU 通信方式的利用率不同。DSA 需要访问完整历史,而 SWA 只需要查看 128 个 tokens。

针对这个差异,AI 提出了一套混合序列并行方案,既保留了 DSA 的长程检索能力,又把 SWA 部分的通信量压了下来。

在其他的一些 Infra 层优化问题上,AI 也深度参与。

例如显存管理问题,AI 会分析哪些中间结果可以暂时转移出显存,哪些可以重新计算,哪些必须留下。AI 还发现并参与修复了位置编码精度和序列索引越界等问题。

也就是说,从架构搜索,到训练监控、并行计算、显存管理和长序列 Bug 修复,AI 这次参与的,已经不是某一个孤立环节,而是一条完整的研发链路。

这也是 N0.5-Flash 最值得注意的地方:它不只是一个 AI 模型,而是一个被 AI 深度参与研发出来的 AI 模型。

400小时搞定人类研究员没做过的方向

在训练 Naive-N0.5-Flash 之外,Naive AI 的研究员们,还把 AI For AI 运用到了更多研究中。

比如 NaiveRT。

它是 NaiveAI 为 Naive-N0.5-Flash 开发的推理系统,核心目标是让模型在大规模 RL 训练里更快、更稳定地产生 rollout,由人类和 AI 协作完成。

在 RL rollout 里的一个痛点,就是模型一个 token 一个 token 往外生成得速度很慢,拖慢了项目进度。而这个 NaiveRT 系统,会让单条长轨迹生成得更快。

具体做法,是 NaiveRT 重写了模型在 GPU 上运行的规律。

模型每生成一个 token,背后要经过 QKV 投影、位置编码、写 KV cache、注意力计算、输出投影等一连串步骤。普通推理系统会把这些步骤拆成很多个 GPU kernel,每一步都要启动、同步、搬运中间结果。

NaiveRT 做的第一件事,就是把这些零散步骤尽量合并。比如一个 DSA 层,原本每解码一步要执行 29 次 kernel,它直接重组成 1 个 mega-kernel,让整条计算链路在 GPU 上更连续地跑完。

第二件事,是让搬数据和计算同时发生。比如 QKV 权重不依赖 RMSNorm 的结果,所以它可以一边提前搬权重,一边做归一化,等真正要算 QKV 投影时,权重已经准备好了。

第三件事,是减少 CPU 调度。投机解码里的 draft、verify、sampling、commit 这些步骤,尽量由 GPU 自己连续推进,而不是每轮都等 CPU 安排下一步。

所以同一套系统上,一轮完整投机解码的耗时从 SGLang 的 12.3 ms 降到 3.4 ms。8 张 GPU 上,single-stream 解码峰值达到 2,122 tokens/s。

图片

这套系统里,AI 也参与研发。研究员负责定方向、设约束、验收结果,AI 负责大量实现、测试和优化。

6 天里,他们记录了 151 轮优化实验。

图片

除了让 AI 参与开发 NaiveRT,Naive AI 还做了一个更开放的实验:让 AI 自己做一个世界模型。

这个案例更接近 RSI 的边界。

世界模型并非 NaiveAI 这家公司的研究方向。所以相比 NaiveRT,这一次 AI 拿到的不再是一份明确的优化清单,它需要更深程度地决定自己的工作。

而这次参与研究的,正是 Naive-N0.5-Flash —— 它提出方案、运行实验、放弃无效方向,并决定下一步尝试什么。

最开始,Naive-N0.5-Flash 想尝试复现一些已有的方案,但效果不好。于是它调整思路,重新改写训练视频的文字描述,不断调整数据比例和视频帧的采样方式,尝试不同的后处理方法。

最后经过累计400小时、15轮主要实验,Naive-N0.5-Flash 开发出的 AutoWM,居然在 WorldArena-1 Track 1 上拿到 77.43 分,高于当时公开榜单最高的73.64分。

图片

这个案例更让人震惊。

因为 AI,已经开始展现一种更接近 RSI 的能力:在一个人类团队并不擅长的方向上,它可以自己提出研究路线,自己实验,自己根据结果调整方案。

当然,这还不是完整的 RSI。

目前无论是 OpenAI、Anthropic,还是 Naive AI,最关键的目标制定和结果评价,仍然掌握在人类研究员手里。AI 还没有真正做到完全自主地提出下一个研究目标,并用实验结果更新自己。

不过,当 Naive-N0.5-Flash 能自己研究人类研究员并不擅长的任务,我相信,RSI 真的已经不远了。

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多