Token导航 LogoToken导航

DeepSeek开源昇腾算力平台基础组件 与英伟达版一一对应

更新时间 2026-09-30来源 观察者网正文 1282字阅读约 5分钟1 张图片

9月30日,DeepSeek发文称,正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、计算库、分布式通信库。所有组件与此前面向英伟达平台的开源组件一一对应。

工欲善其事,必先利其器。建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。

TileLang在这样的历史背景下诞生。

根据公开信息,TileLang由北大团队发起,核心人物除了王磊、董宇骐,还有北大计算机学院的副研究员、博士生导师杨智。该项目由TileLang社区主导开发,旨在简化高性能GPU/CPU内核的开发。它采用Python式语法,让开发者能够专注于提高生产力,而无需牺牲实现最佳性能所需的底层优化。

海外社区曾注意到DeepSeek v3.2使用TileLang,而不是OpenAI开发的Triton语言。

有接触过的开发者感叹TileLang是一种非常优雅的语言,只需不到100行代码就能写出比Flash Attention 2原版快30%的注意力实现。

去年9月,在华为全联接大会2025的开发者日上,TileLang团队成员董宇骐介绍了TileLang实现FlashAttention算子开发,代码量从500+行减少至80行,并保持了与官方版本持平的性能。


TileLang华为

DeepSeek此次表示,一方面,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑。另一方面,相对于其它同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

“TileLang路线首先在英伟达成熟平台上得到了验证,如今已承载了 DeepSeek V4 系列模型训练中大部分算子的实现,是我们探索AGI新范式、开发高性能算子的核心工具。”文章写道。

本次开源的TileLang昇腾版本,对昇腾Ascend C底层指令进行封装、提供高级语言的编程方式、同时不损失硬件性能。

DeepSeek表示,这正是TileLang的设计初衷。目前,DeepSeek 训练中用到的每一个TileLang 算子,在昇腾上都有对应的高性能实现。TileLang昇腾版本作为一个开源工作,希望能对更多AI芯片建立高可用软件生态起到示范作用。

本次开源还包括昇腾平台核心计算与通信组件,为不同使用场景提供可复用的基础能力:DeepGEMM加速通用矩阵运算;DeepEP提供高效的大规模跨设备通信;TileKernels提供数据处理所需的常规向量计算和访存算子;FlashMLA提供稀疏注意力算子,提升长上下文处理效率;DeepSelect则实现了高效的数据筛选。在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。

DeepSeek透露,在面向昇腾平台的研发过程中,华为团队给予了毫无保留的大力支持。双方紧密合作,共同推进基于昇腾950的128卡超节点方案、共同对计算与通信进行了深度优化。“我们将持续推进技术创新,与社区共同建设开放的软件生态、共同进步。”

本文系观察者网独家稿件,未经授权,不得转载。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多