Token导航 LogoToken导航

单超节点最大4096张AI加速卡,华为昇腾960超节点能否成为国产大模型新底座?

更新时间 2026-09-20来源 福布斯正文 1273字阅读约 4分钟

华为近期发布昇腾960超节点,引发广泛关注。单个超节点最大支持4096张AI加速卡,是已商用的昇腾950超节点1024卡的4倍,首次采用NPO近封装光学技术,面向十万亿参数规模大模型的训练与推理。

当前,十万卡集群已成为训练十万亿级模型的标配,但据华为披露,传统服务器架构下集群内通信占用超过40%的训练时间,严重制约有效算力。据华为马尔科夫实验室仿真测算,由4K超节点组成的十万卡集群,模型浮点算力利用率较传统8卡服务器方案提升2.75倍。在同等10万卡规模、同模型并行策略下,有望提升有效算力,降低单位训练成本。

NPO技术的商用对光模块产业链的影响更为直接。NPO将光引擎从交换机面板移至靠近芯片的位置,但光引擎仍保持独立封装、可单独更换。国内头部光模块厂商正推进NPO光引擎研发与送样,昇腾960采用华为自研Hi-ONE,光引擎与DSP自研自产,具体外采配套以厂商公告和客户认证为准。从华为官方数据看,昇腾960超节点用5500个自研Hi-ONE光引擎替代了原本需要的4.8万颗800G光模块,功耗降低超550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%。

需求侧的验证正在从单一案例扩展为群体性趋势。据彭博社报道,DeepSeek拟在内蒙古乌兰察布吉瓦级数据中心部署至少16万颗昇腾950DT芯片,这批芯片用于推理而非训练,与本次发布的960并非同一代产品,双方尚未官方确认,全部交付可能需一年以上。

据美团披露,LongCat-2.0是业界首个完全依靠国产算力完成训练和推理全流程的万亿参数大模型,训练峰值规模超过5万张国产算力卡。据科大讯飞披露,其星火大模型选择全国产算力路线,MoE模型全链路训练效率从2025年3月对标A800的30%提升至93%。据华为昇腾官方称,MiniMax M2.5在开源后数小时内即完成昇腾Atlas 800 A2/A3的适配部署。据财联社等媒体报道,字节跳动2026年AI算力采购规划拟采购超50亿美元国产算力产品,供应商涉及寒武纪、华为昇腾等,具体订单以采购执行公告为准。

截至目前,昇腾910C超节点已部署超1000套,昇腾950超节点也已规模商用。据华为披露,昇腾960DT芯片将于2027年第一季度就绪,较原计划提前三个季度;960PR将于2027年第三季度就绪,提前一个季度。后续昇腾970、980按一年一代推进,分别计划于2028年、2029年发布。据华为披露,多个超节点通过灵衢组网,最大可支持100万卡昇腾超节点集群(规划目标)。生态方面,CANN外部开发者占比达61%,首次超越内部开发者,基于昇腾+CANN的原生训练模型已超40个。昇腾已成为PyTorch官网可直接安装的首个中国算力平台,社区月活开发者突破5200名。需要注意的是,MFU提升2.75倍等数据来自华为自测与仿真,未经第三方验证;百万卡集群及970/980迭代节奏均为规划目标。

国产算力正在从产品发布走向大规模部署,昇腾960超节点能否成为国产大模型的新底座,取决于后续芯片交付节奏与生态迁移进度。

封面图片:公司官网

文章标签芯片大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多