Token导航 LogoToken导航TokenDH.com

1300张卡叫板10万卡!前OpenAI副总裁出手,硬核难题击败GPT-6 Astra

更新时间 2026-09-17来源 新智元正文 3901字阅读约 13分钟11 张图片

图片

  新智元报道  

图片

只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。

近日,前OpenAI研究副总裁Liam Fedus在X上发帖,亮出Periodic Labs的第一个模型:Periodic Neon。

图片

帖子最抓人的是这一句:

只用1300张H200,加上几个月的实验数据,Neon在他们自家的分析基准上超过了GPT-6 Astra。

图片

Periodic门洛帕克高磁场材料实验室实拍,机械臂正在样品上方作业。

上图里,一排排样品托上放着刚合成出来的候选材料,它们会被送进X射线衍射仪拍下「指纹」,再变成Neon要读的图谱。

实验室24小时连轴转,合成、测量、喂数据。

Fedus说,他们第一批要啃的,是超导体、磁体和半导体材料里的硬骨头。

一个做大模型出身的人,为什么跑去啃材料?

Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,最清楚模型靠什么变强。

去年创立Periodic时,他就把话挑明了:

互联网上的文本总共约10T token,最好的前沿模型已经把它读完了。AI要再往前走,需要互联网上没有的新数据。

去哪找?实验室。

于是,他拉上前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从第一天起就自己建实验室、自己造数据,目标只有一个:造一个AI科学家。

一年后,第一份答卷来了。

Neon约1T参数,在一套高难度的X射线衍射(XRD)分析测试上,成功率跑到55.3%,把GPT-6 Astra和Claude Fable 5.1都甩在了身后。

论参数,据业内传闻,Astra总参数在数万亿量级,Neon只有1T;

论算力,按黄仁勋的公开说法,Astra背后是10万张以上的Grace Blackwell;Neon最终训练的峰值规模,只有1300张H200。

这样的反差,很快在圈内炸开。

Jeff Dean第一时间在Fedus的帖子下留言祝贺。

图片

1300对10万,这组数字背后,藏着让AI继续变强的另一条路。

一张考卷
把2.7%拉到55.3%

Neon解决的问题叫X射线衍射分析(简称XRD)。

X射线衍射是什么?

打个比方:一束X射线照进晶体,会在几个固定角度衍射出亮峰。材料不同,亮峰的位置也不同,就像指纹。

合成出来的东西是不是超导体、磁性材料或半导体材料,先要看这枚「指纹」对不对得上。

图片

Periodic Lab里的X射线衍射仪。Neon学习的XRD数据,就由此类仪器产生。

麻烦在于实验室合成的样品往往极不纯净,多种物质重叠在一起,就像几百个人的指纹乱七八糟印在同一张纸上。

材料学家要认清里面有什么,通常得开软件、翻数据库、对比论文,折腾很久。

Periodic挑选了134道这种「连专家都头疼」的硬骨头,组成基准测试FrontierXRD。

Neon的55.3%,就是在这134道题上拿到的。

所有模型用的都是Periodic自己搭的科学工具环境,Periodic Harness。

与基于Claude Code、配标准XRD工具的方案相比,在单题成本差不多的情况下,Periodic Harness的成功率是后者的3.8倍。

图片

AI做科研,一半靠脑子,一半靠手边的工具。

为了防止模型「背答案」,团队还另外准备了198道题,题目涉及的化学体系在训练数据里都被刻意剔除。Neon依然领先一众前沿模型。

不过官方也承认,这套题比FrontierXRD简单。 

成本上,Neon也更划算。

最高档下,Neon成功率55.3%,每题成本约4美元多;GPT-6 Astra每题约7美元多,成绩反而低于Neon;Claude Fable 5.1成本和Astra相近,成功率只有约40%。

互联网就要被AI读完了
他们想造一口永不干涸的「数据水井」

抛开跑分,Periodic真正想让人看到的,是它在门洛帕克建起的高通量材料实验室。

图片

Periodic Lab实拍:机械臂夹取样品送入设备。 

从最初的第一批实验,到如今24小时连续运转,Periodic把材料发现拆成了一个循环:

先猜要做什么,依据是对材料稳定性和性质的预测;

再预测怎么把它合成出来;

最后搞清楚实际做出了什么,性质对不对。拿到结果,修正猜想,再来一轮。

图片

Periodic的材料发现循环:做什么、怎么做、做了什么,三段首尾相接。

每循环一圈,实验室就吐出一批新鲜、私有、带着物理反馈的数据。这些数据,就是Neon的原料。

Periodic的中训练语料,混合了学术文献、代码和实验数据,规模目前每个月翻一倍。

他们还发现,先靠中训练把科学知识灌进去,后面的RL效果更好。

而且实验跑的时候,GPU不用干等。模型可以拿已有的实验数据继续分析、继续改进预测。

Periodic那篇研究博客的标题,叫「自然就是学习环境」(Nature Is Our Learning Environment)。

它瞄准的是AI圈绕不过去的一道坎:

过去几年,Scaling靠的是把互联网数据越堆越多。可互联网上的文本,已经快被前沿模型读完了。

接下来,谁手里有能不断产出新数据的环境,谁就多了一条继续Scaling的路。

互联网是一座挖一点少一点的数据矿,实验室是一口能源源不断出水的井。

自然不给标准答案
Periodic请了个AI裁判

把RL搬进物理世界,难度完全不在一个量级。

数字世界的RL,已经让智能体写出了几乎所有代码,还解开了悬而未决的数学猜想,秘诀是派出海量智能体,去做又快、又能自动判分的题。

到了物理世界,这三样全卡住了:

智能体不能说加就加,多跑一路实验,就要多一份电力、设备和工程;一次实验可能要好几天;结果还经常模棱两可。

最后一条最要命。Periodic在研究博客里说很精辟:科学可以被证伪,却不容易被验证。

一张XRD图谱,光看拟合对不对得上,没法低成本判定分析是否成功。还得有专家来判断,每个物相有没有图谱支持,化学上说不说得通。

Periodic的办法,是把专家的判断「蒸馏」成裁判。

他们请材料专家给数千个XRD图谱打标签,再用这些标签校准一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组,三组数字很能说明问题:

专家和专家之间,一致率77.2%;

LLM裁判和单个专家,一致率74.6%;

LLM裁判和专家共识,一致率84%。

也就是说,这个AI裁判的靠谱程度,已经逼近人类专家彼此之间的水平。

能把「说不清」变成能训练的奖励,是Neon的一项硬核技术点。

 1300对10万
这些卡到底怎么省出来的

1300张H200,是Neon最终训练时,中训练和强化学习两个阶段同时在跑的峰值卡数。

而Astra的10万张以上Blackwell,对应的是一个前沿通用模型的大规模训练。

所以,1300对10万,算不出一个效率倍数,但它至少说明,这1300张卡被Periodic用到了极致。

科学任务上的强化学习,有个怪毛病:模型做一道题,要边想、边查资料、边跑工具,一趟下来可能一个多小时;可拿这道题的结果去更新模型,只要几分钟。

Periodic的办法是,让做题和学习分开,各用各的GPU,互不等待。

这里有个真实的翻车故事。

他们最早的RL循环,训练、推理和模型写的代码全挤在一起,没有任何隔离。

直到有一次,模型写的代码申请了80GB内存,整个任务当场崩掉。

于是有了自研沙箱pbox。

它直接调用RL任务所在GPU节点上闲着的CPU来跑科学工具,数据全程不出集群。

和他们测过的一家托管沙箱服务相比,数据来回快了4.5倍,吞吐量是对方的3.3倍。

训练闲下来的算力,再分给物理模拟等科学计算任务,整个集群的利用率常年保持在95%以上。

Periodic的思路不难理解:算力总量拼不过巨头,就拼每个GPU小时能换回多少科学产出。

飞轮还是那个飞轮
燃料换了

Neon已经部署进Periodic的实验室,分析真实实验,帮团队寻找更好的超导体和磁体。

还差哪一步?

回到前面提到的那个三段循环里,Neon这次证明的只是最后一段:看懂实验室到底做出了什么。

至于让AI指挥整个科研项目、设计合成路径、决定下一轮跑哪些实验,Periodic官方的说法是,正在把这套方法往这些方向扩展。

Fedus的措辞也很克制:模型目前是「帮我们决定」,不是替科学家拍板。

准确地说:实验、数据、训练之间的飞轮已经转起来了,但要实现全自主闭环,还有两个环节没打通:决定做什么,以及怎么把它合成出来。

Periodic也没打算否认算力的价值。

官方表示,把训练算力扩到与今天前沿模型相当的量级,能解锁更强的科学能力。他们也提到,未来可以换一个更强的开放权重模型做底座。

GPU依然重要,但光有GPU不够了。

回头再看Fedus的履历:在GPT-4技术报告的贡献者名单里,他的职责是「数据飞轮」负责人。

三年后,他把这个飞轮从互联网文字搬进了真实的物理实验室。

飞轮还是那个飞轮,变的只是喂进去的东西:从人类写下的文字,换成了自然给出的回答。

下一阶段的Scaling,比的也许不再只是谁能买下十万张芯片,还要看谁的实验室能一刻不停地往模型里送真实世界的数据。

参考资料:

https://periodic.com/news/building-labs-that-learn
https://periodic.com/news/nature-is-our-learning-environment
https://periodic.com/news/ai-infrastructure-at-periodic
https://x.com/LiamFedus/status/1973055380193431965
https://a16z.com/announcement/investing-in-periodic-labs/

编辑:元宇

文章标签OpenAI算力学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多