IT时报记者 孙永会
近年来,大模型的快速发展推动了算力需求暴涨,大模型参数量呈百倍级扩张,训练向万亿参数演进,推理进入超长上下文、海量Token、多模态协同新阶段。
不少业内人士认为,算力底座的竞争已经从单芯片算力比拼转向算网存系统协同能力的较量,大模型正倒逼国产算力芯片行业加速创新。其中,超节点受到行业热议,还将其评价为大规模训推任务的“最优解”,是AI计算与高端通用计算的关键技术方向。
在日前举办的2026华为全联接大会期间,神州鲲泰正式推出基于鲲鹏、昇腾950技术路线的新一代产品。首批发布的新品包括基于鲲鹏950的KunTai R722 K3 均衡型服务器、基于昇腾950DT的KunTai A989 I5标准服务器、KunTai A989 I5 风冷超节点,以及KunTai Pod 2000 A5液冷超节点,覆盖通用计算、大模型训练、高性能推理等场景。
如何把多个节点“拧成一股绳”?
“国产超节点不是芯片简单堆叠,而是属于系统工程,考验硬件、散热、驱动、软件栈全栈协同。”神州鲲泰产品专家孙亚楠在接受《IT时报》等媒体采访时介绍了真超节点与服务器堆叠的差异。
在他看来,真正超节点要同时满足三条硬性标准:其一,专用高速硬件总线互联,区别于以太网 RoCE 消息通信,减少协议转换与数据拷贝带来的时延开销;其二,全域内存统一编址,支持内存语义Load/Store 远端内存,无需数据拷贝,这是和普通集群最本质差异。再者,端到端全栈软硬件协同,芯片、互联硬件、CCU、驱动、操作系统、通信库完整适配。
“仅用以太网组网,哪怕硬件规格再高,只是服务器堆叠,无法突破内存墙与通信瓶颈,算力无法充分释放。”孙亚楠表示,KunTai系列超节点整机全部按照前述的这套标准设计。
伴随鲲鹏950、昇腾950DT原生支持超节点硬件能力,以神州鲲泰为例的整机厂商,已经把超节点从概念推进到可选型产品阶段。孙亚楠进一步指出,但产业尚处早期,需要芯片、整机、操作系统、数据库、AI框架厂商持续协同打磨场景,进而推动规模化商用。
厂商选型时重点看什么?
“整机性能提升1.4倍”,《IT时报》记者了解到,KunTai R722 K3通用服务器在封装技术、可靠性、安全能力等方面有所升级,例如在安全上,其支持内存加密、CCA机密计算架构,实现满带宽内存加密,加密不影响内存访问带宽;此外,CCA架构提供硬件级机密计算环境,实现隔离和保护。KunTai A989 I5标准服务器则适配通用风冷机房,为政务、金融、医疗等行业AI项目提供算力服务。
较之于传统分布式数据库集群,KunTai R722 K3 组网通用超节点能解决哪些痛点?
在孙亚楠看来,传统以太网分布式集群存在三大痛点——跨机访问时延高、内存资源碎片化、IO(输入/输出)硬件资源形成“孤岛”状态。 KunTai R722 K3 通过灵衢总线组网,多台物理节点形成一台逻辑大计算机,跨节点内存,进而省去大量数据拷贝。
在大模型训练过程中,最怕集群中途宕机,一旦发生故障,训练任务大概率要重启,进而浪费算力。“KunTai PoD2000 A5液冷超节点最大可实现1024卡集群部署。”孙亚楠表示,该超节点可在万亿级大模型训推场景中使用,是目前业界最大规模超节点,在超节点域规模、内存统一编址、训练效率、工程全栈优化上实现突破,千卡MTBF(平均无故障工作时间)高达300小时。
(KunTai PoD2000 A5液冷超节点)
再看KunTai A989 I5 风冷超节点服务器,其单计算节点可支持8颗NPU,设备适配企业通用风冷机房,无需改造液冷基础设施,可服务互联网、金融、政务、教育等行业AI的推理业务。
(KunTai A989 I5 风冷超节点服务器)
“通用超节点、AI智算超节点分别解决核心交易业务升级、大模型规模化落地两大底座难题。厂商选型时可以重点看三点。”孙亚楠分享道,一方面,区分真超节点与服务器堆叠;另一方面,看业务负载匹配的能力,核心数据库可以选择R722 K3通用服务器,大模型训推则选用智算超节点;再者,评估机房条件,看用风冷还是液冷装备。







