前几天,The Information 关于代季峰创业的消息,成功引起了我的注意。
报道提到,代季峰在今年2月创办了 NaiveAI。成立小半年,这家公司就完成了4亿美元融资,投资方包括腾讯、红杉、IDG资本。而且它做的是 LLM,这在如今的创业趋势中还挺不常见的。
没想到就在今天,Naive AI 的第一个模型 Naive-N0.5-Flash 迅速浮出水面。
我看了看,发现 Naive-N0.5-Flash 是一个 309B 的 MoE 模型,每次推理只激活 15.5B 参数,原生支持 1M tokens 上下文。
作为一款 Flash 模型,它采用了5层 SWA 搭配1层 DSA 的架构,也就是“5层看局部 + 1层搜全局”的混合注意力机制,资源效率很高。
它的模型权重和推理代码都以 MIT License 开放,将提供 API 访问。API 的输入、输出和缓存读取价格分别为每百万 tokens 0.6、2.6 和 0.07 元。
官方技术报告:https://mp.weixin.qq.com/s/bJaX9oXTGdf5BmO8tF1v1g
说实话,309B 的 MoE 架构模型,放到现在动辄上 T 参数的前沿模型里,肯定不算最炸的那个。
但我看完整个技术报告,却被震撼到了 —— Naive-N0.5-Flash 不仅 Coding 已经挤进国模第一梯队,AI For AI 的实践更是贯穿了整个模型的训练过程。
甚至,它还能帮人类研究员推进团队认知之外的项目。
这个 Flash 模型,某种程度上代表了现在 AI 领域最前沿的追求:模型自进化的进展。
一个擅长Coding和研发的模型
关于模型自进化,有种说法是,Coding 能力是实现自进化的前提。
这从过去两年,Coding Agent 的进化路径里能看清楚。
一开始大模型只能帮工程师补几行代码,后来,它能接 GitHub Issue,自己读代码、修改文件、运行测试。再往后,像 Claude Code、Codex 这样的 Agent 开始连续工作几个小时,自己调工具、看日志、修 Bug。
现在下一道边界已经出现了:
如果一个 Agent 已经能读代码、写代码、运行程序、观察结果并重新修改方案,那它为什么只能开发普通软件,而不能开发 AI 本身?
这件事落地的过程,就是所谓的 AI for AI —— 用 AI 迭代 AI。
目前,这个过程还需要人类研究员给模型布置任务、验收结果。但再往下一步,当模型可以自己找到下一个突破点,自己做实验,自己训练自己,就会实现 RSI。

*A社的RSI进度参考
从 Naive-N0.5-Flash 的训练和评测结果里,这条 Coding 到 AI4AI,再到 RSI 的进化线索已经很明显。
先看 Coding。
在测评结果上,Naive-N0.5-Flash 的 Coding 能力已经进入国模第一梯队,尤其擅长长程、复杂的工程任务。

在 SWE-Bench Pro 上,它拿到 68.8 分,排在 Opus-5.5 和 Opus-5 之后,超过了Qwen-3.8-Max、Hy4-Preview、GPT-5.6-Sol。
估计不少人知道,这个测试会直接丢给模型真实 GitHub 仓库里的软件工程问题,看它能不能读懂完整项目、定位问题、修改代码并把测试跑通。
还有 DeepSWE v1.1。
它主要测更长周期、更复杂的仓库级软件工程任务,更看重模型能不能在较长上下文里持续规划、跨文件修改、理解项目结构,并完成多步骤工程任务。
这一项里,Naive-N0.5-Flash 得分67.8,虽然排在它前面的国模还有 DeepSeek-V4.1-Flash,但依旧超了 Step-5-Preview、Kimi-K3、GLM-5.3 等模型。
NL2Repo 测的是通过一段自然语言需求,让模型从零搭出一个完整的代码仓库。
这一项里,Naive-N0.5-Flash 拿到 71.9 分,是图里最高的一个,超过 DeepSeek-V4.1-Flash 的 64.0,也高于 GLM-5.3、Hy4-Preview 和 Qwen-3.8-Max。
这说明,Naive-N0.5-Flash 不只是会修代码,也很擅长把一个抽象需求拆成完整工程,并持续把它做出来。
还有 Terminal-Bench 2.1。这个测试也很重要,会把待测试模型直接扔到开发环境里,让它执行 Bash、操作文件、安装依赖、调试程序等任务。
虽然这一项 Naive-N0.5-Flash 前面还有 DeepSeek-V4.1-Flash、GPT-5.6 Sol、Muse Spark、Kimi-K3、GLM 5.3 等模型,但这个评测大家咬得很紧,Naive-N0.5-Flash 跟排名第一的模型只相差了不到4分。
另外还有 ALE-CLI、ProgramBench等几项评测,不一一列举了。
总之,这些 Coding 测试的结果说明,Naive-N0.5-Flash 是一个能理解复杂系统,操作真实环境,连续执行多步任务,也能根据反馈不断修正方案的模型。
这正是模型参与模型研发之前,必须先跨过的一道槛。
Coding 之外,真正让我对这个模型另眼相看的,是 AI R&D 的测试结果。
AI R&D Bench 测的是模型做研发的能力。
换句话说,它不只是看模型会不会写代码,还看模型能不能帮人做模型训练、论文复现、机器学习实验和 GPU 优化。
这一步,基本就是 AI For AI。

比如 PostTrainBench。这个测试会直接给模型一个固定的算力预算,让它自己去做语言模型后训练。
Naive-N0.5-Flash 的得分是 37.5,排在 GPT-5.6 Sol 和 GLM 5.3 后面,高于 Kimi-K3、Fable 5 和 Hy4-preview。
还有MLE-bench-30。这项测试让模型面对 Kaggle 一类机器学习任务,自己完成数据处理、建模、训练和优化,更像在考一个 AI 工程师。
这一项里,Naive-N0.5-Flash 拿到 73.7,高于 Sonnet-5 的 66.9% 和 Gemini-3.6-Flash 的 63.9%。
PaperBench 也很能说明问题。
它会给模型一篇机器学习论文,看模型能不能读懂论文,并真正把论文里的研究复现出来。这已经非常接近研究员的工作,而不是普通 Coding。
Naive-N0.5-Flash 在这一项得分 63.2,在官方这张测评结果里排第一,高于 Claude Opus 4.7 的 58.5、GPT-5.5 的 57.5、MiniMax M3 的 52.6 和 Gemini 3.1 Pro 的 46.7。
剩下还有优化 GPU Kernel,以及训练模型的测试,Naive-N0.5-Flash 的表现都蛮亮眼。
一个由AI深度“制造”的模型
为什么 Naive-N0.5-Flash 在 AI 研发上表现得尤其突出?
答案就在它的训练过程里。
官方披露,Naive-N0.5-Flash 在长达 3T tokens 的继续预训练中,重点强化了 AI 研发和编程能力。
其实,Naive-N0.5-Flash 本身就是这套 AI 研发方式的产物。
在它的研发过程中,很多重要工作都由研究员负责提出目标、设定约束、判断结果,AI 负责提出方案、运行实验和分析数据。
这套思路,从 Naive-N0.5-Flash 的架构设计,一直延续到模型的训练和 Infra 优化。
先说架构。
Naive-N0.5-Flash 基于开源模型 MiMo-V2.5 后训练而来,中间还有架构改造和 3T tokens 继续预训练。
但它没有完全沿用 MiMo-V2.5 的注意力结构,而是改成了每 5 层 SWA + 1 层 DSA 的混合注意力机制。
这个改动,本身就是一次 AI 参与模型设计的实践。

修改注意力机制的原因是,MiMo-V2.5 原本有几层全局注意力,在处理 1M token 的超长上下文时会遇到效率瓶颈,上下文越长,计算和读取的压力就越大。
研究员为了改进这一点,给 AI 定义了一个明确的目标:模型必须继续支持 1M tokens 上下文,但计算耗时要下降,同时还要尽量保住模型质量。
AI 接受任务后,开始了循环实验。
它负责实现候选架构和训练方案、运行消融实验、比较不同方案并汇总结果,然后由研究员从满足目标的方案中作出选择。
最后,Naive-N0.5-Flash 采用了每 5 层 SWA + 1 层 DSA 的混合注意力结构。
架构确定下来后,问题还没有结束。
原来的全局注意力知道该关注哪里,但新加入的 DSA 索引器一开始却不会,这需要单独训练索引器,让它学会在找到真正重要的信息。
AI 继续深度参与了这个过程。它会自动检查索引器选出的结果,并与原来的全局注意力的结果做对比。发现问题后,AI 会自行修复再重新运行实验。如此循环,直到研究员判断可以正式切换到 DSA。
到了 1M tokens 训练阶段,AI 参与的优化就不只是模型结构,而是整个训练系统。
首先是两个不同注意力机制对于 GPU 通信方式的利用率不同。DSA 需要访问完整历史,而 SWA 只需要查看 128 个 tokens。
针对这个差异,AI 提出了一套混合序列并行方案,既保留了 DSA 的长程检索能力,又把 SWA 部分的通信量压了下来。
在其他的一些 Infra 层优化问题上,AI 也深度参与。
例如显存管理问题,AI 会分析哪些中间结果可以暂时转移出显存,哪些可以重新计算,哪些必须留下。AI 还发现并参与修复了位置编码精度和序列索引越界等问题。
也就是说,从架构搜索,到训练监控、并行计算、显存管理和长序列 Bug 修复,AI 这次参与的,已经不是某一个孤立环节,而是一条完整的研发链路。
这也是 N0.5-Flash 最值得注意的地方:它不只是一个 AI 模型,而是一个被 AI 深度参与研发出来的 AI 模型。
400小时搞定人类研究员没做过的方向
在训练 Naive-N0.5-Flash 之外,Naive AI 的研究员们,还把 AI For AI 运用到了更多研究中。
比如 NaiveRT。
它是 NaiveAI 为 Naive-N0.5-Flash 开发的推理系统,核心目标是让模型在大规模 RL 训练里更快、更稳定地产生 rollout,由人类和 AI 协作完成。
在 RL rollout 里的一个痛点,就是模型一个 token 一个 token 往外生成得速度很慢,拖慢了项目进度。而这个 NaiveRT 系统,会让单条长轨迹生成得更快。
具体做法,是 NaiveRT 重写了模型在 GPU 上运行的规律。
模型每生成一个 token,背后要经过 QKV 投影、位置编码、写 KV cache、注意力计算、输出投影等一连串步骤。普通推理系统会把这些步骤拆成很多个 GPU kernel,每一步都要启动、同步、搬运中间结果。
NaiveRT 做的第一件事,就是把这些零散步骤尽量合并。比如一个 DSA 层,原本每解码一步要执行 29 次 kernel,它直接重组成 1 个 mega-kernel,让整条计算链路在 GPU 上更连续地跑完。
第二件事,是让搬数据和计算同时发生。比如 QKV 权重不依赖 RMSNorm 的结果,所以它可以一边提前搬权重,一边做归一化,等真正要算 QKV 投影时,权重已经准备好了。
第三件事,是减少 CPU 调度。投机解码里的 draft、verify、sampling、commit 这些步骤,尽量由 GPU 自己连续推进,而不是每轮都等 CPU 安排下一步。
所以同一套系统上,一轮完整投机解码的耗时从 SGLang 的 12.3 ms 降到 3.4 ms。8 张 GPU 上,single-stream 解码峰值达到 2,122 tokens/s。

这套系统里,AI 也参与研发。研究员负责定方向、设约束、验收结果,AI 负责大量实现、测试和优化。
6 天里,他们记录了 151 轮优化实验。

除了让 AI 参与开发 NaiveRT,Naive AI 还做了一个更开放的实验:让 AI 自己做一个世界模型。
这个案例更接近 RSI 的边界。
世界模型并非 NaiveAI 这家公司的研究方向。所以相比 NaiveRT,这一次 AI 拿到的不再是一份明确的优化清单,它需要更深程度地决定自己的工作。
而这次参与研究的,正是 Naive-N0.5-Flash —— 它提出方案、运行实验、放弃无效方向,并决定下一步尝试什么。
最开始,Naive-N0.5-Flash 想尝试复现一些已有的方案,但效果不好。于是它调整思路,重新改写训练视频的文字描述,不断调整数据比例和视频帧的采样方式,尝试不同的后处理方法。
最后经过累计400小时、15轮主要实验,Naive-N0.5-Flash 开发出的 AutoWM,居然在 WorldArena-1 Track 1 上拿到 77.43 分,高于当时公开榜单最高的73.64分。

这个案例更让人震惊。
因为 AI,已经开始展现一种更接近 RSI 的能力:在一个人类团队并不擅长的方向上,它可以自己提出研究路线,自己实验,自己根据结果调整方案。
当然,这还不是完整的 RSI。
目前无论是 OpenAI、Anthropic,还是 Naive AI,最关键的目标制定和结果评价,仍然掌握在人类研究员手里。AI 还没有真正做到完全自主地提出下一个研究目标,并用实验结果更新自己。
不过,当 Naive-N0.5-Flash 能自己研究人类研究员并不擅长的任务,我相信,RSI 真的已经不远了。







