Token导航 LogoToken导航

阿里10万亿参数大模型是否用真武V900训练

更新时间 2026-09-22来源 未尽研究正文 2413字阅读约 8分钟2 张图片

国产10万亿参数模型时代正在逼近。成立8年的平头哥,也终于站到了关键位置。它为阿里巴巴打造了最强中国自研AI芯片,同时加速迭代CPU、网络、互联与存储,全栈优化。

在今天的云栖大会上,阿里巴巴集团CEO吴泳铭表示,机器智能时代的代表性产品还没出现,但未来机器思考的总量将达到人类的1000倍以上。这与阿里刚刚重新划分的内部业务结构形成对应,也与平头哥息息相关。

“AI云与算力服务”板块,负责承载未来机器思考所需要的庞大算力。平头哥可以通过降低每单位电力和基础设施的成本,改善推理的经济性。

“AI实验室与应用”负责寻找机器智能时代的代表性产品,离不开更大规模参数的模型。此前,国内厂商已尝试用国产算力训练万亿参数模型,但前沿模型门槛已经拔高到3万亿左右;字节跳动更是被传在训5万亿以上的模型。如今,阿里第一个明确公开喊出,要训练自己的10万亿参数模型。

于是,平头哥新发布的新一代“训推一体”AI芯片真武V900,很自然地成为了其中最关键的一环。这款被吴泳铭称为“目前中国算力性能最强” 的AI芯片,可以构建50万卡单一集群,支撑前沿模型的训练和推理。

图片

中国AI芯片的迭代速度,正在明显加快。真武V900的重磅出场,也铺垫已久。最近连续三个季度的财报电话会,吴泳铭都有意“重点介绍”平头哥。尤其是最近一次,从技术到产能,从推理到训练,几乎面面俱到。前几日,华为昇腾960系列提前量产的消息,再次加深了市场对平头哥下一代AI芯片也将加速发售的预期。

这一提前,就是半年。年初,阿里云峰会首次披露真武系列AI芯片路线图。当时,真武M890作为真武810E的后续产品,在今年二季度正式亮相,性能提升至三倍;而真武V900原计划在明年三季度上市。如今,短短几个月后,真武V900就确认将在明年一季度量产售卖,性能也较M890再次提升至三倍。

迭代加速,背后是平头哥8年的技术积累,也是Qwen过去两年的持续发力。阿里巴巴正在走向一条芯片与模型协同优化的路径。为自己的业务与模型,量身打造更高效的芯片,正是谷歌TPU的关键叙事之一。阿里巴巴同样如此。

阿里对外披露的性能指标,仍然相对有限。不过,仅就内存容量与片间互联带宽而言,真武V900分别提升到了216GB与1200GB/s,差不多是去年TPU v7的水平,甚至略高。将与真武V900同期上市的本土AI芯片,也被外界寄予训练国产模型的期待,DeepSeek据称采购了16万颗,其FP8精度算力为2 PFLOPS。而“国内最强”的说法暗示了真武V900更在此之上。

国内AI芯片正在逐步摸到训练前沿模型的门槛。更重要的是,面对10万亿规模参数模型,无论是训练还是推理,计算都不再由单颗芯片定义,计算就是整个数据中心。这需要全栈的协同能力,既包括基础设施与模型架构之间的协同,也包括不同芯片之间的协同。

英伟达近年来持续向模型生态延伸,其中一个重要原因,正是芯片厂商需要更早了解模型架构演进,才能提前洞察算力硬件的方向。OpenAI的Jalapeño能够在短短9个月里跑完底层设计到最终流片,并在量产部署第一代的同时兼顾二三代开发,也不仅仅是因为AI参与了设计,更因为AI工作负载在设计之初就决定了芯片架构。

阿里巴巴恰好同时站在开源模型和国产算力两个生态中。它是开源模型的领军者之一,除了和自家Qwen系列模型紧密协同,阿里也与Kimi等前沿AI厂商保持密切合作。近3万亿的Kimi-K3刚一发布,阿里M890超节点就宣布Day 0适配。这离不开阿里云、平头哥与Kimi团队从软件栈、算子等层面的深度合作。

这样的芯模协同经验,首先在推理场景中得到验证,也有可能进一步迁移到训练,为将来扩展至10万亿参数规模积累工程经验。

芯片之间的协同同样关键。一个芯片环节的提升,往往又会把瓶颈推向另一个环节,这也是阿姆达尔定律(Amdahl's law)所揭示的系统级约束所在。算力基础设施的通信能力会影响并行策略,并行策略又会影响显存占用和训练效率。

这也是为什么,无论是英伟达还是华为,今年都在主题演讲中集中展示了自己的芯片全明星阵容。谷歌早已布局TPU与OCS,但首颗自研CPU Axion直到 2024年才真正问世;今年7月底,谷歌又与Marvell签订新的商业协议,由后者围绕谷歌TPU生态,定制开发存储控制器、网络接口控制器、内存接口控制器等半导体产品。

而平头哥的全栈芯片组合,今年经历了一次集体迭代。早些时候,平头哥发布了自研互联芯片ICN Switch 1.0与智能网卡磐脉920,更早之前,还推出了存储主控芯片镇岳510。

通过ICN Switch,真武V900具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。这套互联体系,也支撑了真武V900单一集群最高50万卡的扩展能力。

这次云栖大会,与真武系列AI芯片同台亮相的,还有服务器CPU倚天系列。这是平头哥首次公布倚天CPU的路线图,也是在2021年发布倚天710后,该系列迎来首次重要迭代。

图片

明年的倚天730,是平头哥首款基于全自研CPU微架构设计的产品;而第二代自研CPU内核的倚天750,将进一步支持自研ICN片间互联总线协议,让倚天CPU与真武AI芯片直接互联,深化全栈AI优势。

同样是全栈协同优化,既然TPU早已支撑Gemini训练,V900为何不能承担下一代Qwen的训练?尤其是在先进AI芯片供应受限的情况下,国产算力必须尽早补位;而最先做到这一点的算力厂商,获得的也将远不只是象征意义。

模型的下一代,正在等待算力的下一代。

阿里的灵骏真武M890超节点已在乌兰察布首批开服,并将扩容至宁夏中卫。下一代磐久服务器和灵骏超节点,也会在V900提前量产后第一时间部署。阿里正在训练Qwen4,后续5万亿乃至10万亿参数规模的Qwen4.5与Qwen5,或许将与底层算力平台的代际跃迁相互呼应。

文章标签大模型芯片
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多