撰文 | 李信马
题图 | DoNews摄
“今天中国日均Token消耗量约500万亿,以一张卡每秒2000个Token吞吐来推演,一天8万6千400秒,100万亿的Token,需要57万8千700卡,考虑实际使用过程中负载的变化,通常需要乘一个1.3的系数,即需要75万2千300卡,这是智算的规模。对于整个Infra,还要有沙箱、调度、MCP Server等通算服务器,支撑100万亿Token,大约需要7万台通算服务器。”
9月19日,在华为全联接大会2026期间,华为计算首席战略官朱照生在他的主题演讲中先算了这么一笔账。进入Agentic时代,数据中心越建越多,但似乎还是不够用,有时候,一个长程的Agent任务则可能十几分钟甚至几个小时。Agent的每一次思考、评估与回滚,都在放大算力的成本;当Agent开始介入企业与个人的日常,分钟级的等待差异,就是效率的分水岭。
当Token成为新的生产要素,算力的分布与互联方式,正在成为决定智能化进程快慢的关键变量。正如朱照生所说:“Token的输出,应该像闪电一样!”而问题的关键,就是要解决时延的挑战。随着大模型规模迈向十万亿级,单台服务器已经满足不了模型的训练和推理,超节点集群也因此成为Agentic Infra中的正在进行时。2026世界人工智能大会(WAIC)期间发布的《超节点定义与实践白皮书》将超节点为一种在物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。朱照生认为,未来通算与智算将在同一个机房,通算也要走向超节点,以满足多Agent交互所需要的海量沙箱,并瞬时启动。
自然而然的,Agentic开发与计算的变化,也会同步发生。
01、算力新底座
我们回溯下算力的演进就会发现,从单机多卡、多机集群到“超节点+集群”,需求侧的变化驱动着架构的变化。模型参数量与训练集群规模的同步膨胀,让传统集群的局限越来越明显。这种局限是物理性的,通算与智算通常分布在不同机楼,相距数百米甚至数公里;光走一米需要5纳秒,1公里的RTT就消耗10微秒,如今Agent高频交互中的等待基本都发生在网络交换层,把毫秒级的延迟累加为分钟级。
所以,为了解决这个问题,华为面向“超节点+集群”提出了Agentic计算新开发方式,覆盖从单服务器到超节点开发、从进程走向Agent思程开发、从SIMD到SIMD+SIMT新同构开发、从HiF8走向低精HiF4、从人工算子编程到Agent编程调优五大维度。
面向超节点的开发,华为为开发者提供全面的、原子化的开发接口。对于离散、高频次的小块数据计算与通信场景,超节点的内存语义接口,即跨物理节点的load/store同步访问,可以大幅降低整个超节点的通信开销。“举个例子,一个256专家并行系统中,如果每颗芯片跑一个Expert,支持96个用户并发,那么模型每一层All to All的通信次数超过700万,其中超过90%的通信只有几个字节的小包。”朱照生解释。
而超节点消息语义接口,URMA异步访问可以支持连续的大块数据的通信。这样,不仅海量Agent的沙箱能轻松实现秒级启动,KV Cache的多级存储、搜索、推荐等场景,一样可以利用鲲鹏通算超节点来提升性能与收益。
过去操作系统以“进程”管理按预定逻辑执行的程序,在Agent成为主流的运行对象后,需要对开放的目标不断探寻最优解,操作系统也需随之调整。openEuler提出了 “思程” ThinkProcess(简称ThinkPro),作为Agent思考、执行、探索和演进的基本单元,无论是状态管理、还是CPU、内存等硬件资源的抽象,思程ThinkPro都提供了原子级API:包括User Space API 和 Kernel Space API,方便开发者根据自己的需要灵活调用。其中,User Space负责状态管理,支持创建退出、状态融合与回滚;Kernel Space提供资源抽象,实现通算与智算的融合调度与异构池化。
面向昇腾950新代际,Ascend C新增了SIMD与SIMT混合编程模式,开发者可以根据数据特征,在一个算子内核内自由组合两种模式,例如常用的gather and add算子,先以SIMT实现离散访存,再以SIMD完成连续数据累加;同时新增了RegBase编程模式,将数据搬运与Reg计算交给开发者自由控制。虚拟指令集层面,PTO-ISA已形成包括基本运算、数据搬运、通信等8大类、120余条虚拟指令,通过Tile级抽象实现代际兼容、让算子源码跨代迁移,并以Auto/Manual双模式支持细粒度操作底层硬件。用朱照生的话说:“Ascend C的全新升级,目的是给开发者提供更高性能且更自由的编程环境。”
数据格式的演进方面,低比特是AI计算的既定方向,华为去年发布了8位浮点格式HiFloat8,过去一年HiFloat8进展超预期,团体标准已经完成,今年8月在TC28完成国标立项,并已申请IEEE study group;超过100家科研单位与企业加入HiFloat社区,涵盖高校、行业伙伴及高通、科大讯飞等头部企业。
围绕主流模型的训练与推理,HiFloat8已完成从芯片、算子、训推框架到模型应用的全流程验证——训推精度与BF16平均误差在0.5%以内,性能较BF16提升约30%。面向更低比特,HiFloat4以E6M2全局缩放因子与2级局部微阶码,在4bit范围内实现更高精度的元素表达。预计未来几个月,基于HiFloat8的模型将陆续推向市场。
最后,从算子生成,到模型适配、精度调优,再到行业部署,华为构建了覆盖全流程的Agent能力,加速AI原生应用在昇腾上的落地。CANNBot可帮助开发者自动生成算子,常见Vector类算子仅需3小时,而传统人工开发往往以天计;模型适配环节,Model Agent自动编排工作流与优化方案,免去繁琐的模型迁移与适配;MindStudio Agent支持从集群到芯片的多级精度调优,压缩到小时级;行业落地环节,Solution Agent内置300多个参考部署方案,可在几分钟内完成最佳参数寻优,做好AI落地的“最后一公里”。
02、生态商业化
聊完了Agentic计算新开发方式,我们也要清楚,它能否落地,除了技术,还取决于生态的规模、厚度与开放程度。
过去七年,鲲鹏生态完成了从起步到规模化的跃迁。openEuler在2019年12月推出,2021年捐赠给开放原子开源基金会,累计部署已超过2000万套,保持中国服务器操作系统第一份额;鲲鹏产业汇聚416万开发者,与7200家各行各业的ISV伙伴联合打造了2.8万个解决方案,并已在金融、互联网、运营商、数字政府等行业核心生产系统全面商用落地。金融的Core Banking、手机银行,运营商的 CRM、计费,互联网的搜索、推荐、广告等,都是典型的行业解决方案。目前鲲鹏冷热数据识别准确率达99%,KAE压缩开销不到5%(业界通常为20%),沙箱内存超分率达30%,一家股份制银行在同等业务性能下,每台服务器内存需求从512GB降至384GB。
但更令人惊喜的,是昇腾生态的进展。现场,朱照生的一句话震耳欲聋:昇腾已经跨越了生态拐点!
为什么这么说?从今年6月起,CANN社区就成为了中国活跃度最高的开源社区,月度活跃用户数超过5200,非华为开发者数量首次超过华为开发者,日均新增合入代码超过3万行;基于CANN原生训练的大模型与多模态模型已超过40个。今年7月28日,昇腾成为PyTorch社区官方支持的首个中国算力平台,全球PyTorch开发者可直接选择在昇腾硬件上开发创新。
让开发者真正参与生态,是华为接下来的核心落点。昇腾开源社区上线了万卡算力集群,注册即送100卡时,开发者提交Issue、PR即可获得积分,以积分换取更多卡时。对个人开发者与中小企业而言,万卡集群不再是少数大厂的专属资源,而是按贡献即可触达的公共能力。社区的基础设施也在Agent化,CI/CD等待时间从几十分钟压缩到分钟级,Issue自动答复与PR自动审核的质量与人类专家基本持平,从写代码到合入形成完整闭环。
资金方面,华为已明确过去三年投入30亿元,未来三年再投入50亿元,建设开源开放的算力新生态:
- 能力筑基。依托华为鲲鹏昇腾社区和开发者学习中心,为开发者提供场景化的成长路径与知识体系,帮助开发者打好技术基础。
- 持续创新。依托鲲鹏昇腾生态创新中心、卓越孵化中心等,提供技术与资源支持,与高校和企业开展联创,让开发者在实战中持续打磨和提升技术能力。
- 产研协同。通过鲲鹏昇腾种子计划与伙伴计划,从资源、技术、市场等多方面提供支持,与开发者共创未来。
华为把新一代算力基础设施的每一步,都与开发者生态的开放程度绑定在一起。
结语
当Agentic时代到来,算力不再是单点性能的堆叠,而是基础设施的分布与互联、开发范式的开放与效率、生态规模的厚度与活力。华为以开源开放为路径,以“超节点+集群”为底座,把选择权交给开发者,Agentic时代的答案不会只来自一家企业,但我们期待,Agentic时代的算力真的能“像闪电一样”,随叫随到、低时延、高吞吐。
关于华为计算的故事,仍在继续。








