智谱正在“摸高”AGI,华为要做英伟达。模型与算力之间的连接点,在于高效产出token的基础设施。中国AI生态,正在默契地从两端向着同一个方向协同。
这一周,智谱解密了Infra Agent如何优化10万卡国产算力集群,帮助旗下GLM-5.3-Flash在6天吞吐了62万亿token;在“进一步加大投入与优化”后,智谱很快迭代出推理提速数倍的GLM-5.3-FlashX。
智谱还没有透露过,旗下10万卡国产芯片集群究竟由哪些厂商构成。但从当前国产AI芯片的市场格局来看,华为在其中至少应该是主力;智谱曾提到“以通信换显存”,以及这一集群由“自研高带宽互联网络连接”,正是华为的优势与布局。
在本周华为全联结大会上,华为加速了昇腾系列AI芯片的迭代节奏,业内首个规模量产了NPO,并将国产算力集群的可扩展性,推高至百万卡级别。它的灵衢互联是灵魂。今年5月的“韬定律”,以及今年9月的“嵌套并行冯·诺依曼架构”,是华为全联结大会2026的行动纲领。
推理的经济学,最终比拼的,是每单位电力和基础设施能够创造多少收入。这不再是单独一块GPU或者一款模型所能解决的问题,而需要从芯片、节点、集群,以及推理引擎到模型架构,建立系统性的优化策略。在任何一个环节提升少量效率,可能收获系统复利,优化大规模服务的成本结构与利润空间。中国原生的算力和模型,正在踏上这条路。
智谱的Infra Agent
智谱GLM-5.3-Flash对国产算力集群的优化,不到两周,累计提升至3.2倍端到端token吞吐量。这也是该团队“硬件效率和单token成本已达到与主流英伟达GPU相当的水平”的依据,因为业界相信国产AI芯片与英伟达之间存在着两三倍的差距。
在技术博客里,智谱表示,为克服单张芯片算力与内存容量相对有限的问题,团队“以算力换带宽、以通信换显存”,在SGLang的基础上构建了专用的推理引擎,工作范围不仅包括算子的开发与优化,也包括性能瓶颈诊断以及部署服务栈的改进。

这是一个庞大的系统工程。推理系统中的精度异常、性能退化或者性能优化目标未达成预期,往往来自算子实现、并行策略、通信行为、内存管理与服务调度等多个层面的动态交互。
经验丰富的工程师,可以根据一次测试结果,选择下一种观测手段,逐步检查每一个环节,并将来自不同工具的信息联系起来。但这非常考验团队人才深度,无法轻易“扩展”。
每一步都意味着反馈,这恰恰又是智能体能发挥关键作用的地方。智谱GLM团队披露,他们尝试在GLM-5.3-Flash的推理基础设施上,引入了Infra Agent(基础设施智能体)的反馈闭环。智能体可以根据测试、轨迹、基准等“稠密反馈”,自主提出假设、修改代码并验证结果。智谱创始人唐杰与GLM团队认为,这是递归自我改进(RSI)的早期形态。
在智谱看来,这些反馈信号之所以“稠密”,并不意味着它们的量非常大,而是它们足够“本地”、“易得”、“客观”。也就是说,反馈信号是直接关联到具体的参数或路径的,更容易复现;更短的验证周期,也就意味着更少的无效投入;修改是否准确、性能是否改善,通过控制变量的对照实验验证。

性能的优化,往往是按下这头,翘起那头。智谱引入ReplaySSM技术,期望“以算力换带宽”,但最初却遭遇了算子执行时间延长的问题。Infra Agent一步步揪出了真正的原因,最终压榨带宽成功。
为了缓解传统注意力机制KV缓存“爆炸”的问题,智谱等国内开源模型厂商引入了线性注意力。但是,后者把“记忆”压缩成固定大小的“状态”,需要不断在HBM读出与写入,;ReplaySSM的核心思路在于,不再每一步都把完整读写,而是必要时才重建状态,这就需要一点点计算为代价。
但智谱的初步尝试发现,ReplaySSM新增的计算量,超过了节省显存访问带来的收益。于是,Infra Agent首先优化了除法操作,效率有所提升,但幅度并不大;这意味着它没有触及主要瓶颈。后来,它定位到大量不必要的重复计算的存在,并最终通过牺牲一点并行度,换来了更少的计算,也就真正释放了“以算力换带宽”的效果。

智谱已经尝到了AI优化推理集群的甜头,还会继续加码。上市以来,智谱2026年内累计融资额已超过755亿港元;最近一次拟募资超过393亿港元,其中约60%将投向下一代GLM基础模型和“完全自训练”(Fully Self Training)体系,以及大规模训练、推理和算力基础设施的部署与升级。
日前,智谱发布了GLM-5.3-FlashX,推理速度最高200 tokens/s,较GLM-5.3-Flash提速5倍,价格则相应提升2.5倍。这证明10万卡国产算力集群不仅在高吞吐能力上足够好用,在低时延上也能继续改善用户体验。三周时间就进一步优化了国产算力集群,会不会很大程度上也正得益于Infra Agent?
这也不是智谱一家的方向。DeepSeek的拿手好戏,向来就是压榨算力基础设施效率。最近,DeepSeek-V4.1-Flash通过跨层复用和FP4量化,全局KV缓存降至每Token约890字节,约为上一代V4-Flash的1/4。官方称,新模型的HBM需求降至上一代的1/4、SSD需求降至1/8。
DeepSeek也在抢购华为芯片,数量至少16万卡,建设自己的GW级数据中心;它同样在用AI优化算子。
以灵衢为灵魂
而在算力侧,华为也在响应本土AI生态的需求。在ICT和计算领域,它的目标是成为英伟达,确保全球任何大模型,都能在华为的昇腾、鲲鹏、超算节点和集群上高效运行。
想要成为英伟达,华为需要遵循半导体的物理法则,也需要独辟蹊径。今年至今,华为已经发表了两篇关键论文,尝试为自己提供一套新的解释框架与技术叙事。
一篇是华为半导体业务负责人何庭波的《多层电子系统的时间扩展理论》,即“韬(τ)定律”。它的核心思路,是不再将晶体管几何尺寸的缩小,视为半导体持续进步的唯一方向,而是从信号传播时间、逻辑结构等方面,寻找计算性能继续提升的空间。
它的现实价值,在于为短期内先进光刻仍然无法国产替代的AI算力,找到一条单芯片性能继续“等效”进步的道路。但它首先会在消费电子芯片上尝试,真正的AI芯片的“逻辑折叠”,需要等到2030年前后,即昇腾990这一代际。
另一篇关键论文,为国产AI算力“长达”数年的过渡期指明了方向。它是华为半导体首席科学家、昇腾总架构师廖恒撰写的《嵌套并行冯·诺依曼架构与嵌套式BSP》。廖恒认为,冯·诺依曼教会我们,如何构建一台存储程序计算机;但八十年来的错误推论是,认为将多台计算机连接成网络就能形成一台更大的计算机。
如何在单一环节继续提升性能之外,找到从芯片、节点到大规模计算系统的整体扩展路径。论文提到,实现该原理的硬件,就是灵衢(UnifiedBus)。
在这周的华为全联接大会2026期间,AI芯片仍然是最吸引市场目光的。华为宣布下一代的960DT比原计划提前三个季度,2027年第一季度就绪;960PR比原计划提前一个季度,2027年第三季度就绪。
华为仍然在追赶与英伟达的单卡性能的差距。这一次,华为针对FP4进行更深度的优化;“黄氏定律”也是这么干的。在FP4精度下,960PR的算力性能为8 PFLOPS,是FP8精度下的4倍,而非传统的2倍;这也相当于B300的约53%。而除了算力指标,明年发售的960DT,在内存与通信等性能上都超越了当前一代的B300。

但本届全联结大会,最能反映“成为英伟达”的场景之一,就是华为拿出来围绕灵衢互联的11颗关键芯片,涉及算、存、管、联,比英伟达的Vera Rubin架构还多4颗。这是将更多处理器连接成一台逻辑统一的计算机的基础组件。

华为发布了全新的超节点(SuperPoD)与超节点集群(SuperClusters)。其中,昇腾960超节点,可扩展至4096卡规模,是950超节点的4倍;而910C只能构建384卡的超节点。此外,多个960超节点可以通过二层CLOS四平面组网与多轨道拓扑技术,将超节点集群的最大规模,分别扩展至51.2万卡与100万卡。
更大更高效的算力集群,不仅为越来越庞大的智能体群体提供算力,也将是SOTA模型预训练的关键。
这一次,华为明确提到了十万亿参数级的SOTA模型的预训练。在传统计算架构下,集群规模扩大,资源利用率反而下降。但华为看到,在同样十万卡集群下,4096卡超节点组成的集群相对行业八卡服务器组成的集群,MFU(模型浮点算力利用率)可提升2.75倍。

为了让超节点更为高效,华为还发布了推出了全球首个NPO光引擎Hi-ONE,以及全新的AI记忆存储架构OceanStor M900。
在昇腾960超节点,用5500个Hi-ONE替代原本的4万8千颗800G光模块,可以降低超550千瓦功耗。简单推算一下,这相当于为单个超节点省下了482万度电/年,10万卡集群就相当于1.2亿度/年。去年,中国的AI芯片市场合计超过400万卡,而到2030年中国算力规模之上将较2025年大幅增长6倍多。
更重要的是,尽管通信环节的功耗并不直接生产Token,但热管理决定了整个算力系统能否持续以目标功率运行,进而影响实际的Token产出。
而它的AI记忆存储架构,根据不同工作负载需求,基于灵衢“一跳直通”,避免协议转换和CPU转发,在典型AI编程场景中,可实现推理集群Token吞吐率翻倍、首Token时延缩短一半。

目前,一个由25.6万卡组成的Atlas 950超集群正在部署。梁文锋曾提到过,目前闭源前沿模型的活跃参数已经达到了8000亿,达到这一水平,需要5万张GB3000 ,或者不少于20万张昇腾950。
OpenAI用了十万张英伟达GB200/300集群训练出了GPT-6 Astra,目前正在部署一个40万卡GPU的集群。
数十万卡集群、十万亿参数模型,中国本土AI生态,正在从算力与模型两侧出发,围绕同一个效率目标自然协同,并将在明年逐步兑现。







