Token导航 LogoToken导航

代季峰团队开源首个模型

更新时间 2026-09-28来源 机器之心正文 6994字阅读约 22分钟10 张图片

编辑|Panda、小熊猫

Naive AI 正在探索一条令人兴奋的新路径:让当前的 AI 模型去承担下一代模型的研发工作,并且让每一代诞生的模型都能够比上一代承担更多的研发工作。

10 天前,Anthropic 公布了一组少见的内部数据:公司内部的 AI 研发工作中,已有 26% 由 Claude「主导」完成。所谓主导,是指研究员只需给出一条高层指令,Claude 就能端到端地完成任务的大部分,人类负责监督。而在今年 2 月,这个比例还不到 1%。

而这并不是一个孤立事件。更早几天,OpenAI 宣布去年定下的「自动化研究实习生」目标已经达成:按标准工作日折算,其研究团队每投入 1 个人类工作日,就有约 3.1 个智能体工作日在同时运转。

9 月 21 日,OpenAI 又提议由美国牵头制定前沿 AI 全球技术标准,并把递归式自我改进(RSI)列为重点议题。

国内,智谱也在 9 月 17 日披露,由 GLM-5.3 驱动的 Infra Agent 在十万卡国产集群上,从零搭起了 GLM-5.3-Flash 的推理服务。

图片

OpenAI 博客中对 RSI 的定义

短短半个多月,「让 AI 研发 AI」就已经从一个偏理论的话题变成了头部实验室争相公开的量化指标。

但仔细看,这些数字回答的大多是同一个问题:研发下一代大模型,AI能接手多少工作?

而就在今年 2 月,当 Anthropic 的 AI「主导」比例还接近零的时候,代季峰的创业团队 Naive AI 成立了。

这家新创公司从一开始就摒弃了传统以人类为中心的研发体系,把写代码、跑实验、监控流程、分析结果等研发工作交给了 AI 模型。而人类研究员把精力集中于三件事:提出目标,设定约束与评价标准、最终决策。

从第一天起让 AI 研发 AI,这家新公司交出了首款模型

路线选择上,Naive AI 专注于开源模型后训练与 Agent 研发,没有从零预训练,而是以开源模型为起点,做架构改造、增量预训练和后训练。

开源生态正在成为新一批实验室的起点。前 OpenAI 首席技术官 Mira Murati 创办的 Thinking Machines Lab,7 月推出的首款模型 Inkling 虽是从零训练,架构却沿用了 DeepSeek-V3 的混合专家设计。

Naive AI 更进一步,直接基于开源基模继续训练和改造。开源基模已经足够强,新实验室的竞争点,正从「能不能从头训出一个基模」,转向「能不能更快、更好地把基模改造成自己要的样子」。

Naive AI 押注的,正是后者背后的研发效率。

其刚刚发布的首款模型Naive-N0.5-Flash,总参数量为 309B,激活参数量为 15.5B,原生支持百万 token 上下文,面向编程与 AI 研发。

图片

它有一个双重身份:由 AI 参与研发,也被专门训练来承担AI研发工作。

技术报告显示,AI 已经参与了注意力架构的探索,以及训练、推理和部署系统的优化。研究员设定目标、约束与评价标准,AI 据此实现候选方案、运行实验,并根据结果继续调整;涉及架构选择等关键决策,仍由研究员把关。

官方的两个配套案例,让这套研发方式有了具体的呈现:

  • 在推理运行时 NaiveRT 的优化中,研究员与 AI 用六天推进了 151 轮实验,将同一系统的一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒。

  • 另一项任务中,Naive-N0.5-Flash 接下世界模型研究工作,经过累计 400 小时、 15 轮主要实验,持续调整数据、训练方案与推理策略,最终得到 AutoWM,其已跻身 WorldArena 第一梯队。

此外,Naive AI 实习生、清华博士生 Shiqian Su 也在 𝕏 上分享了一个使用 Naive-N0.5-Flash 训练 Jev 模型的示例,所得到的多模态类 Jev 模型在俄罗斯方块与贪吃蛇这两个小游戏上的表现非常亮眼,均优于 Jev 以及开源的 Laya。

让Naive N0.5承担训练工作,训练出来的多模态模型负责玩俄罗斯方块和贪吃蛇。环境与数据准备、模型和训练方法选择、测试构建,以及后续的训练、评估、纠错和迭代,都由Agent自行推进。这个过程中,Agent还会根据获得的证据调整方案。

这些案例背后,Naive AI 正在尝试把模型投入后续研发,让它参与解决下一轮迭代中的实际问题。而这条路线的起点仍是模型本身的能力:它能否读懂论文、实现方法,并在一连串实验之后,找到值得继续推进的方向?

围绕这些问题,Naive AI 的首份技术报告给出了从模型设计、训练到研发任务评测的一套结果,也让外界得以具体观察,这个创业团队准备怎样进入大模型竞争。

摒弃传统,走向 AI 原生的研发方式

把一篇机器学习论文交给模型,距离得到可以检验的复现结果,中间还有很长一段路。模型需要理解方法、完成实现、组织实验,还要处理运行过程中不断出现的问题。

围绕这些研发任务,Naive-N0.5-Flash 交出了一组非常亮眼的核心评测结果。

先看考察论文复现能力的 PaperBench。Naive-N0.5-Flash 取得了 63.2 分,高于报告中的 Claude Opus 4.7、GPT-5.5和 MiniMax M3。

对于一款面向 AI 研发的模型,这项成绩提供了一个直接的观察窗口:面对论文中的研究方法,它能将多少内容落实为具体实现。

机器学习工程提供了另一种考验。在源自 Kaggle 竞赛任务的MLE-bench-30上,Naive-N0.5-Flash 取得了 73.7% 的成绩,任务涉及围绕数据开展模型训练与实验。

进一步聚焦模型研发,在要求固定计算预算下进行语言模型后训练的 PostTrainBench 上,它取得了 37.5 分。

图片

Naive-N0.5-Flash 的 AI 研发相关评测与优化结果,涵盖模型后训练、机器学习工程、论文复现、训练和 GPU 算子优化。

这几类评测覆盖了研发中的不同环节。论文复现关注对已有研究的理解与实现,机器学习工程考察解决具体任务的能力,后训练任务则要求模型在资源约束下寻找改进方案。它们共同提供了判断模型能否参与研发的依据。

上图中还有一组对照值得留意。在 Sol-ExecBench(GPU 算子优化)、NanoChat AutoResearch(固定预算下的训练改进)和 NanoGPT SpeedRun(训练提速)三项任务上,比较对象是 Recursive Superintelligence。这家由 Richard Socher担任 CEO、田渊栋参与联合创办的公司,专做自动化 AI 研究。

该公司在 6 月公布了首批结果:社区优化了两年多、累计 83 次人类刷新纪录的 NanoGPT Speedrun,被它的系统从 79.7 秒压到了 77.5 秒——而现在Naive-N0.5-Flash将这个成绩提到了 73.8秒。

编程能力是完成这些工作的基础。在要求根据自然语言需求生成代码仓库的 NL2Repo 上,Naive-N0.5-Flash 得分为71.9,高于 DeepSeek-V4.1-Flash。

在面向长程专业任务的 ALE-CLI 上,它取得 32.4 分,接近 GPT-6 Astra与 Opus 5.5。

图片

Naive-N0.5-Flash 的编程与长程任务评测结果,涵盖软件工程、代码仓库生成、终端操作等任务。

看起来,Naive-N0.5-Flash 在论文复现、机器学习工程和长程任务中,展现出了相当强的竞争力。

研发任务还有一个实际特点:工作推进得越久,需要处理的历史信息往往越多。一次训练报错,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,又需要回看已有结果及其对应配置。

而原生 1M 上下文为保留这些任务历史提供了空间。代码、工具返回与实验记录能够被纳入更长的交互过程,为模型关联分散信息、持续推进任务提供支撑。

按照报告披露的开放方案,Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,将提供 API。输入、输出与缓存读取的价格,分别为每百万 token 0.6 、2.6 和 0.07 人民币,研究者和开发者可以据此选择部署与接入方式。

长上下文也会带来具体的计算负担。要让模型在持续交互中保持可用的运行效率,注意力计算、跨卡通信和显存管理都需要跟上。Naive AI 对模型架构与训练系统的改造,正是围绕这些问题展开。

接下来,我们进一步看看首款新模型的诞生过程,AI 同样承担了不少具体工作。

研发 N0.5,AI 参与到了哪一步?

研发 Naive-N0.5-Flash ,首先要解决百万 token 上下文带来的效率问题。团队以开放权重的 MiMo-V2.5 base 为起点:这个基模的大多数层采用滑动窗口注意力(SWA),关注局部信息,少数全局注意力层负责保留长程信息。上下文增长到百万 token 级别后,这几层全局注意力会贡献相当一部分解码开销。

Naive AI 将改造目标放在了这些层上,用 DeepSeek 稀疏注意力(DSA)替换全局注意力。DSA 先通过轻量索引器对历史位置打分,再选出其中的 2048 个位置,交给主干网络计算注意力;SWA 则处理 128 token 的局部窗口。整个网络以五层 SWA 搭配一层 DSA 的布局为主,构成一套混合稀疏注意力架构。

图片

SWA—DSA 混合注意力架构

团队还采用了四个 KV 分组的 GQA,并设计了具有 16 个 query 头的轻量索引器,进一步调整索引与注意力计算的开销。需要说明的是,DSA 的索引器仍需扫描完整历史,相关层也仍需保留完整 KV 缓存,这套改造主要减少了主干注意力的计算量与访存量。

图片

把索引器的查询头从64个减到16个,可以显著降低长上下文稀疏注意力的处理耗时。

这套方案由研究员与 AI 共同探索得到。研究员设定目标与评测协议,要求在提升长上下文解码效率的同时保持模型质量;AI 负责实现候选架构、运行消融实验并汇总结果。在满足目标的方案中,研究员最终选择了工程实现较为简洁的一种。

改完注意力结构,模型还需要重新适应信息的读取方式。 为此,Naive-N0.5-Flash 在 1M 上下文配置下完成了累计 3.25T token 的多阶段训练:

  • 首先,最初的 50B token 用于索引器预热:冻结模型其余参数,让准备切换为 DSA 的层继续使用全局注意力,再以其注意力分布为监督信号,通过 KL 散度损失训练索引器。

  • 随后,模型切换到稀疏注意力,进行 3T token 的继续预训练,以语言建模损失为目标,适应新的信息选择与聚合机制,并强化编程和 AI 研发能力。

  • 最后,再用200B token进行监督微调(SFT),并逐步降低学习率。

这次切换中,AI 承担了一项验证工作:以全局注意力结果为参照,分析索引器选出的 top-2048 位置的召回情况。报告称,AI 在这个过程中发现并修复了 top-k 选择的数值稳定性问题,又独立验证了修复结果。研究员据此确定切换时机与精度阈值,并统一训练和部署阶段的验证标准。

更深一层的工作发生在训练系统中。百万 token 的序列需要被分配到多张 GPU 上处理,如何交换各卡上的信息,会直接影响训练效率。

AI 在分析混合架构时,抓住了两类注意力的访问差异:DSA 需要完整历史,SWA 关注左侧的局部窗口。基于这一点,它提出并验证了混合序列并行方案:DSA 层使用 Ulysses 序列并行,通过 all-to-all 重分配访问完整序列;SWA 层采用重叠分片,与左侧相邻分片交换必要的重叠区域。

这样,SWA 部分的通信复杂度就从随序列长度增长的 O(L),降到了与窗口大小相关的 O(w)。这一思路也被延伸到推理侧,让长上下文预填充、按行分片计算和索引检索分别采用相应的上下文并行方案。

显存管理同样需要细化。针对稀疏索引与注意力对齐产生的中间激活,AI 分析重计算路径,将卸载粒度细化到单个算子的输出,让不同中间结果可以分别配置卸载策略;top-k 索引则显式保留,在重计算时继续使用已选位置。长序列下的检查还发现了位置编码精度问题和序列索引越界风险。

按照披露的数据,这套训练系统在 1M 上下文配置下,使用 512 张 GPU,约四天可以完成 1T token 的训练。支撑研发运行的基础设施还包括沙箱、算力和权限管理平台,公司称其每周支持近千万次沙箱运行,峰值并发达到十万个。

这些细节让「AI 参与研发」有了具体内容:它需要理解计算依赖,找到数值或性能问题,再通过实验判断修改是否有效。研究员负责设定约束和作出关键决策,AI 承担大量分析、实现与验证工作。

同样的研发方式,也延伸到了接下来的推理系统优化与世界模型研究中。

两个 Demo 案例:AI4AI 能力有多强?

NaiveRT 和 AutoWM 提供了两个具体观察窗口,分别展示了 AI 在底层系统优化和跨领域研究中的参与方式。

NaiveRT 是一个推理运行时。

它针对长程强化学习任务中的一个实际问题:单条任务轨迹可能需要持续生成大量 token,少数耗时特别长的轨迹,就可能拖住整个训练批次。提高单条序列的解码速度,有望缩短这些样本的等待时间。

围绕这个目标,研究员与 AI 在六天内推进了 151 轮优化实验,其中 63 轮的改动被采纳。AI 分析整网性能,实现候选方案,再通过数值验证和多卡测试检查结果,优化涉及算子融合、数据搬运和 GPU 执行调度等多个环节。

实验中也有走不通的方向。例如,一条 MoE 算子融合路径连续尝试了七轮,每一版的数值结果都正确,端到端性能却全部下降。分析发现,原有算子边界的开销已经大部分被执行重叠覆盖,融合又引入了额外同步,研究员最终叫停了这个方向。

最终,在同一套系统上,NaiveRT 将一轮包含草稿生成、验证、采样与提交的完整投机解码,从 SGLang 的 12.3 毫秒缩短至 3.4 毫秒,延迟下降 72.4%。

在八张前沿 GPU 上,它还测得 2,122 token/s 的单流解码峰值:这一数字来自 41 个 HTML/SVG 生成请求中的最佳一秒窗口,测试关闭思考模式,且不计入预填充时间。

图片

NaiveRT 单轮投机解码耗时对比

图片

AI 参与研发的过程:151 轮实验中,63 轮改动被采纳、71 轮验证失败或回滚、17 轮用于探索。曲线上的下降台阶,对应一项或多项改动进入实际执行路径。

AutoWM 将任务扩展到了世界模型研究。

一位研究员向 Naive-N0.5-Flash 给出研究目标、算力预算和评测协议,此后由模型持续推进方案设计、训练与评测,并根据实验结果决定下一步尝试。

研究从复现 FlowWAM 开始。早期对无分类器引导和时间步的调整提升有限,模型随后转向数据与训练方案:重写视频描述,将训练集从 2500 段视频扩充至 22500 段,筛除评分较低的样本,并调整帧采样和 rollout 结构。换用更强的基模、配合更高质量的数据后,成绩继续提高。

随着实验推进,模型还发现,WorldArena 的部分指标无需真实参考视频即可计算,可以被用于指导输出选择。它开始搜索不同时间步生成的结果,将帧选择建模为用动态规划求解的背包问题,并进一步探索 Best-of-N 视频选择与后处理策略。搜索规模扩大也未必有效,其中一项配置中,N=32 的表现反而低于 N=16。

累计 400 小时、15 轮主要实验后,团队按 WorldArena-1 Track 1 的公开协议,在视频质量评测中测得 77.43 分,高于报告记录的当时公开最高成绩 73.64 分。

这项结果包含训练改进、推理时筛选和后处理的共同贡献,也记录了模型如何在实验反馈中逐步调整研究路线。

图片

AutoWM 研究进展曲线

Naive AI 将这类实践视为探索递归式自我改进(RSI)的一部分:让模型参与后续模型与系统的研发,再逐步扩大它能够承担的工作范围。

迈向递归式自我改进(RSI)

2026年进入大模型赛道,Naive AI 选择了一条不同的路:用 AI 研发 AI 。以开放基模为起点,它围绕研发任务强化Naive系列的能力,同时让AI深入参与架构改造、训练与系统优化。

这次披露的技术报告和两个案例,让这条路线有了一批可以具体检验的成果。

接下来,更值得关注的是,这些成果能为下一轮研发带来什么。推理速度提升,可以缩短实验中的生成等待;模型更擅长读论文、写代码和分析结果,也有机会帮助研究员更快找到有效方案。如果这些改进能够持续积累,团队就有望在相同的时间和资源预算内,推进更多有效的探索。

这也是Naive AI希望逐步形成的递归式自我改进(RSI)闭环:让AI参与后续模型与系统的研发,再让提升后的能力继续推动下一轮改进。

放到整个行业里看,RSI 到底指什么,眼下仍在争论之中。

OpenAI 在 9 月 21 日的提案中明确表示,完全自主的 RSI 目前尚未发生,在能够安全实现之前也不应追求。Anthropic 同样强调,Claude 在其统计的任何一类研发工作中都尚未完全自主。

谷歌与 Google DeepMind 等机构在 9 月中旬发布的 Dream-RSI 则走了另一条路:模型权重不动,只让智能体从过往的搜索记录中学习更好的探索策略。「自我改进」改的究竟是权重、系统,还是做研究的方法,各家给出的答案并不相同。

Naive AI 目前的实践,同样是研究员把握方向、AI 承担大量执行。它的不同之处在于目标:让研发的产物和研发的执行者逐渐合二为一,Naive 系列既是这套体系造出来的模型,也被训练成这套体系里的研究员。

两个案例已经展示了 AI 承担具体研发任务的潜力,这种能力能否持续转化为下一代模型的进步,还需要后续迭代来回答。

图片

  • 模型地址:

  • https://huggingface.co/NaiveAI/Naive-N0.5-Flash

  • 代码仓库:

  • http://github.com/NaiveAI-Labs/Naive-N0.5-Flash

  • 官网链接:

  • https://naive.ai

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多