
华为想用“两个套娃”造一台百万卡计算机 | 图 AI生成
作者/ IT时报 郝俊慧
编辑/ 孙妍
如果简单以“突破冯·诺依曼单机架构”为华为Peerium打上标签,未免消解了这个计算机架构的真正价值。
9月17日,华为在全联接大会上发布了一系列技术成果和产品,其中包括Peerium计算架构、灵衢UnifiedBus(简称UB)系列互联设备,以及采用NPO(近封装光学)技术的Atlas 960超节点。在官网发布的一篇新闻稿中,华为称“Peerium突破了冯·诺依曼单机架构”,颠覆了长久以来的主从架构,实现了百万级处理器真正整合为一台更大的计算机。
然而,这个说法在业内很快引起巨大争议。质疑者认为,并不存在“冯·诺依曼单机架构”这样一种技术分类,经典冯·诺依曼架构讨论的,是存储程序计算机如何组织计算、存储与输入输出,而Peerium也并没有脱离这些原则。而且,在华为的英文新闻稿中,这句话的表达为“扩展了(extends)冯·诺依曼单机架构”。
事实上,如果研读华为Fellow、海思半导体首席科学家、昇腾总架构师廖恒同期发表的论文《Nested Parallel von Neumann Architecture and Nested BSP(嵌套并行冯·诺依曼结构与嵌套BSP)》便会发现,这篇详解Peerium的论文从未声称“突破”,反而在表述上非常谦逊,“We are continuing von Neumann's idea(我们仍在延续冯·诺依曼的思想)”,且表示构建这种分层嵌套式并行计算系统,并未改变(冯·诺依曼架构)核心原理;改变的仅仅是计算机的规模、嵌套层数以及单个指令可覆盖的范围。
严格意义上,Peerium是将硬件和软件都依据“冯·诺依曼架构”层层嵌套,变成一个个“套娃”,而且“软硬套娃”之间一一对应,理论上可实现的结果是,百万张卡整合为一台计算机,以满足不断发展的AI算力需求。
如果将华为今年一系列技术突破连起来看,便会发现华为试图建立的,是一条从计算理论、软件并行模型,到体系结构、互连技术,再到超节点和百万卡集群的完整路线。

硬件“撞墙”
十万卡利用率仅两成
廖恒的论文不长,只有7页,他用了大量的比喻来解释技术问题,通篇就是在回答一个问题:当处理器数量达到10万或100万时,我们是否依然掌握设计方法?
今年华为全联接大会上,华为常务董事、ICT BG CEO杨超斌在演讲中提到,传统8卡服务器堆出的10万卡集群,MFU(模型算力利用率)仅约20%,大量算力消耗在等待通信完成上。与此同时,10T参数模型需要保存海量中间数据,单卡HBM(高带宽内存)越来越难独立承担;进入Agentic AI阶段,CPU、NPU、内存和存储之间的关系进一步复杂化。一个Agent可能频繁调用模型和工具,产生大量键值缓存,即大模型推理时保存已处理内容中间结果的数据,并需要CPU完成控制、沙箱等工作。
论文开宗明义点出了当前AI竞赛的困境:硬件一样会“撞墙”。芯片竞赛曾像两位武术家对练:谁出拳更狠,谁就胜出。但人工智能竞赛的对抗方式截然不同,数以百万计的士兵投入战场,关键已不再是谁击打得更猛,而是军队能否保持阵型。当兵力达到十万或百万时,胜负便取决于两点:如何将这些士兵整合成一支军队,以及一旦整合成功,这支军队是否仍是一个统一的计算机系统。
这个问题,HPC(高性能计算,即超算)领域早些年便已遇到。图灵奖得主、哈佛大学教授Leslie Valiant曾在1990年发表的论文中提出了解决办法:BSP(批量同步并行)模型。
其核心思想十分简单:将整个计算分为不同的并行计算任务,在每个阶段中,各部队并行推进,彼此之间无须等待,而当部队抵达指定位置时,整支军队会在同一条线上形成屏障。越过屏障后,部队交换必要物资,并整合必要资源。一旦交接完成,它们便一同进入下一个阶段,再次并行推进。如此,规模难题变得可解。
华为在此基础上加入“Nested(嵌套)”概念,即将这样的军团计算逻辑部署于每一个层级,每个军团之间并行前进,而每个军团内部划分为小军团执行相同的四个步骤:并行计算、屏障操作、数据交换与聚合,以及进入下一阶段。在此单元之下是更小的层级,层级嵌套,递归贯穿始终。

图源:pexels

层层“套娃”
关系最密切、距离最近
论文用了一个通俗易懂的比喻来形容这种嵌套——套娃。
首先是“软件套娃”。今天训练一个大模型,数据并行(DP)、流水线并行(PP)、专家并行(EP)、全分片数据并行(FSDP)、上下文并行(CP)、张量并行(TP)等各类计算任务可能同时存在,大规模计算任务会被分解为每一层均可处理的子任务,从最外层到最内层,各层级分别为DP、PP、EP、FSDP、CP以及TP,指令逐层传递,而且每个较大的套娃内部包含许多较小的套娃,比如一个DP包含许多PP,一个PP包含许多EP,一个EP包含许多FSDP碎片,由此整个计算体系得以协同运作。

相较于传统计算模式的主从式,嵌套式BSP每一层级中的各单元为对等节点,既不存在必须掌控所有屏障的“主单元”,也不存在仅能服从的“从单元”。
举个例子,A、B、C、D四个计算单元共同执行这一层BSP,大家同步完成计算任务并交换数据,在同步屏障处集合后,再一起进入下一个阶段,并不要求A必须是Master,由A来检查B、C、D是否完成,再由A向所有人下达“现在可以进入下一阶段”的命令。
换句话说,百万颗处理器可以被分成军、师、旅、营这样的计算单元,却不意味着每一级都必须设置一个掌控所有同步操作的“指挥官”,也即论文中提到的“并行性被嵌套化,而权威性则未被嵌套化”。
然后是硬件“套娃”,包括核心、芯粒、芯片封装、基板、机架、SuperNode、数据大厅、数据中心,以及最外层的数据中心间区域等,每个自主运行区包含多个数据大厅,每个数据大厅包含多个超级节点,每个超级节点又包含多个机架,直至最底层的封装单元,物理尺度从毫米、厘米、米逐渐扩大到百米乃至千米,层层嵌套。

关键一点是,上层“软件套娃”与“下层硬件套娃”要尽可能逐层对齐。软件里面那些通信最频繁、对延迟最敏感的并行,尽量放在硬件最里面、距离最近、带宽最高的范围;再外一层的软件并行,对应更大的硬件范围;不断向外,最终一直扩展到Super Node甚至更大的集群。
就像一家公司中,同一个工作任务的项目组最好坐在一个办公室,而一周才开一次会的不同事业部,可以分散在园区。Peerium想做的,就是让软件中的“谁和谁最需要频繁交流”,尽可能对应硬件中的“谁和谁离得最近”。

统一协议
将“悬崖”改成“缓坡”
计算规模越往外扩,处理器数量越多,物理距离也越远。那么,如何让两组不断扩大的“套娃”仍然保持足够高效的通信?
这正是灵衢要解决的问题。
传统计算机存在一条明显的物理边界。在服务器内部,CPU、GPU、内存等设备可以通过高速互连交换数据,延迟可以做到纳秒级;可一旦走出服务器甚至机柜,处理器之间往往进入另一套网络通信体系,需要经过协议处理、数据封装和转发,通信速度急剧下降,论文把这个变化形容为“悬崖”。
Peerium希望把这座“悬崖”修成“缓坡”。灵衢采用统一的开放协议,目标是在芯片封装、板卡、机架、超节点乃至更大的物理尺度上保持相同的通信语言,这样做虽然不能改变距离越远、延迟越长的物理规律,但减少了以往不同协议和访问语义之间切换的时间。
从华为透露的信息来看,Atlas 950超节点及其超节点集群是Peerium计算架构的首代产品,25.6万卡Atlas 950超节点集群已经在部署,基于NPO的Atlas 960系统正在测试中。

根据华为的官方说法,从扩展性来看,多个Atlas 960超节点采用灵衢网络或RoCE(一种基于以太网的高速内存直连协议)连接在一起,可以构建更大规模的超节点集群,通过二层CLOS(Spine-Leaf叶脊结构)四平面组网,最大集群规模可达到51.2万卡,再结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。

理论很美好
落地仍要跨过几道关
不过,尽管Peerium提出了一个足够宏大的架构目标,但从论文公开的信息看,仍有一些关键问题在真实落地场景中可能会遇到。
首先是故障域。随着模型参数不断增加,训练过程中发生故障成为“常态”,当某一层正在等待所有节点到达Barrier(同步屏障)时,如果其中一颗处理器或者一条链路突然失效,系统如何快速绕过、重构或者重新映射任务?
其次是实际扩展效率。尽管华为官方宣布,25.6万卡的Atlas 950超节点集群已在部署中,但实际模型训练的有效算力究竟能保持多高的增长比例,也是个问题。
论文提出了三个需要重点解决的方向:首先交换机必须具有高基数,也就是交换口要足够多,从而减少中间层;其次,计算芯片的链路也必须具备高基数特性,从而拓宽整支队伍的通信数据出口带宽,也就是说,芯片本身也是一个节点,这样当某一个链路失效时,另一条路径仍然可以维持运行;第三,采用近封装光学技术,将光纤传输至计算芯片的最边缘区域,铜导线只负责最后的几厘米。
由于光互连在长距离传输中具有更明显的带宽和损耗优势,因此即便整个系统组件分布在不同地方,逻辑上仍是一个完整的计算机系统。
事实上,这也与华为此前提出的另一个概念——韬定律一脉相承,两者底层逻辑相似:当算力规模越来越大,真正稀缺的不再只是计算能力,而是时间。
“套娃”同样是一种折叠方式,不仅折叠了时间,还在折叠时间的同时,形成了更强大的有效算力。
回头看文章开头的争议,今天科技发展的速度远超我们想象,快到定义还没写完,便可能翻篇了。与其急着给一项技术“贴标签”,不如看看它真正跑起来后,究竟能解决什么问题。毕竟,通往ASI的路上,没有捷径。
排版/ 季嘉颖
图片/ 华为 pexels AI生成
来源/《IT时报》公众号vittimes
E N D

大家都在看


IT时报

怕被AI替代?
不如先学会用好它
「挨踢妹@AI茶水间」
每日投喂
扫码即可加入↓↓↓

请加「星标」不错过我们








