Token导航 LogoToken导航

DeepSeek开源昇腾全套工具替代英伟达训练大模型

更新时间 2026-10-02来源 封面新闻正文 2798字阅读约 9分钟4 张图片

封面新闻记者 温彦博

训练前沿大模型对英伟达软件体系的依赖,正在出现新的解法。

国庆假期前夕,DeepSeek通过官方公众号宣布,将一整套面向华为昇腾芯片的开发工具免费开源,这套工具与DeepSeek此前在英伟达芯片上使用的版本一一对应。DeepSeek表示,其训练大模型时用到的每一段底层计算程序,如今在昇腾芯片上都有了对应的高性能版本。

图片

同一套代码,可在英伟达与昇腾芯片上运行

芯片的算力要转化为模型训练能力,需要大量底层计算程序负责调度运算和数据传输,业内称之为“算子”。

英伟达的软件体系,核心是其CUDA编程平台。CUDA推出近二十年,全球数百万开发者在其上积累了大量此类程序,主流大模型的训练代码多基于它编写。这些代码与英伟达硬件深度绑定,企业若改用其他芯片,需要逐一重写并重新调优。国产AI芯片的硬件指标近年来持续提升,但迁移成本始终是企业更换芯片时绕不开的问题。

图片

封面新闻获悉,本次开源的TileLang提供的是另一种思路。这门编程语言由北京大学计算机学院团队主导开发,2025年1月开源。DeepSeek方面表示,建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。据介绍,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑;相对于其他同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

更关键的是,它不与特定硬件绑定:只要芯片厂商完成一次底层对接,基于TileLang编写的程序即可直接在该芯片上运行。换言之,迁移成本从“企业重写全部代码”,转变为“芯片厂商完成一次适配”。

图片

事实上,DeepSeek是这一路线的早期采用者。

2025年9月,DeepSeek在发布V3.2-Exp模型时首次同步开源TileLang版本的算子;目前,其V4系列模型训练中的大部分算子均基于TileLang实现。这一路线此前主要在英伟达平台上得到验证。此次开源的,是TileLang在昇腾上的完整实现,以及与英伟达版本一一对应的五个配套组件,覆盖矩阵运算、长文本处理、多芯片通信等训练核心环节。据悉,在软件层面,DeepSeek训练前沿模型所用的代码已可在昇腾平台上运行,无需重写。

“一一对应”在部分项目上已落到接口层面。按照项目更新说明,其中的TileKernels在新增昇腾后端后,同一组Python接口可同时在英伟达GPU和华为NPU上调用,由程序在运行时自动选择对应的底层实现。

在性能上,DeepSeek与华为共同推进了基于昇腾950芯片的128卡超节点方案,即将128块芯片高速互联、作为一个整体协同运算,并对计算和通信做了深度优化。DeepSeek称,在多项关键测试中,相关组件的计算与通信性能已接近硬件理论上限。

据公开信息,面向昇腾950的稀疏注意力算子,在读取输入阶段达到410 TFlops,为硬件极限的95%;在逐步生成内容阶段达到360 TFlops,为83%。

这是双方协同的又一步。2025年8月,DeepSeek发布V3.1时采用UE8M0 FP8数据格式,并说明该设计针对即将发布的下一代国产芯片,模型方开始主动为芯片设计提供参照;同年9月29日,V3.2-Exp发布并开放相关算子实现,昇腾同日实现适配,TileLang-Ascend项目也于当天开源;2026年4月24日,V4预览版发布,华为宣布V4在昇腾首发,寒武纪、海光、摩尔线程等多家国产芯片厂商也相继宣布完成适配,但这些适配针对的是已训练完成的模型,由各家芯片厂商分别完成。此次公开的则是开发和训练模型的底层工具,其他研发团队可直接使用。

国产芯片或首次共享算子生态

比单一平台适配更值得关注的,是TileLang所处的位置。

TileLang位于模型与芯片之间,不归属于任何一家硬件厂商。芯片厂商只需提供编译后端和底层指令接口,上层基于TileLang编写的算子生态即可复用。昇腾此次开放了Ascend C与PTO ISA底层指令体系,上层算子生态即可复用。

这一思路指向的不止华为一家。

长期以来,国产AI芯片各有一套自己的软件体系,寒武纪、海光、摩尔线程、沐曦等厂商需各自搭建算子生态,开发资源分散;模型厂商每适配一家,都是一次新的迁移。若各家芯片共同对接TileLang这样的中立语言层,国产AI芯片有望第一次拥有跨芯片共享的算子生态,长期存在的碎片化问题将出现解法。

DeepSeek在公告中表示,希望此举能为更多AI芯片建立软件生态起到示范作用。目前,摩尔线程、沐曦、算能等厂商均已与TileLang开展适配合作。

图片

软件之外,算力供给与生态规模仍待检验

这套工具链能走多远,还要看各方的实际投入。对DeepSeek而言,这一选择与其自身处境直接相关。

今年4月DeepSeek V4发布时,DeepSeek彼时坦言,受高端算力限制,V4-Pro的服务能力十分有限,预计昇腾950超节点批量上市后,其价格才会大幅下调。据悉,DeepSeek创始人梁文锋在近期的投资者会议上表示,公司将超过70%的算力用于模型训练,留给推理的算力不足30%。在训练占用大部分算力、高端芯片供给又受限的情况下,昇腾是现实可得的选择,而要让这部分算力真正转化为能力,软件层面的打通是前提。

值得注意的是,DeepSeek宣布开源的同一天,华为基于昇腾950的智算集群云服务也在国内正式商用。软件工具的开放与算力供给的落地,出现在同一个时间点上。

对华为而言,此次合作契合其一贯的算力路线。华为此前公开表示,受制于先进制程,昇腾单颗芯片的算力与英伟达仍有差距,因此选择以“超节点+集群”的方式,通过大规模高速互联弥补单芯片性能的不足。在这一路线下,多芯片之间的通信效率直接决定集群的整体表现,此次双方联合优化的重点正在于此。

软件生态方面,华为于2025年8月宣布昇腾底层软件平台CANN全面开源。据华为今年9月披露,CANN开源社区中非华为开发者的数量已超过华为开发者,基于昇腾完成预训练的大模型已超过40个。

不过,从公开的项目文档看,相关组件目前仍有部分功能处于开发阶段,部分性能测试基于华为提供的验证版硬件完成,正式商用版本尚待推出。作为对比,英伟达CUDA平台自2006年推出以来,已积累数百万开发者用户。TileLang能否获得更多开发者采用、是否会有更多模型厂商跟进,以及昇腾芯片后续的性能迭代与产能供给,将决定这一生态的实际规模。

DeepSeek表示,TileLang昇腾版本作为一项开源工作,希望推动更多AI芯片建立高可用的软件生态。华为方面也表示,将与DeepSeek等模型团队持续开展芯片与模型的协同创新。

【如果您有新闻线索,欢迎向我们报料,一经采纳有费用酬谢。报料微信关注:ihxdsb,报料QQ:3386405712】

文章标签DeepSeek英伟达模型发布开源芯片大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多