Token导航 LogoToken导航

DeepSeek开源昇腾基础设施组件

更新时间 2026-09-30来源 腾讯科技正文 2163字阅读约 7分钟1 张图片

图片

文|苏扬

编辑|晓静

9月30日,DeepSeek宣布开源面向华为昇腾的基础设施组件,涵盖TileLang算子编程语言及其编译支持、计算库和分布式通信库,并强调:“所有组件与此前面向英伟达平台的开源组件一一对应。”

DeepSeek正将支撑自家模型研发的核心工具和算子能力,系统地扩展到昇腾平台。双方的合作,由模型适配进一步深入训练与推理所依赖的基础软件。

官方还披露,DeepSeek与华为共同推进基于昇腾950的128卡超节点方案,并对计算与通信进行深度优化。

01 让核心研发工具有另一条硬件路线

这套开源里,最关键的角色是TileLang。

大模型研究中的新想法,需要通过算子变成芯片能够执行的计算。算子开发越复杂,研究者验证新结构、优化训练效率所需的时间就越长。DeepSeek对TileLang的期待,是让开发者用更简单的语言编程,同时保留充分利用芯片性能的能力。

按照DeepSeek的介绍,相较CUDA,TileLang能够简化代码逻辑、提高开发效率;相较其他同类高级语言,其编程模型能够更充分地发挥芯片特性。这条路线先在英伟达平台得到验证,如今已承载V4系列模型训练中大部分算子的实现,是DeepSeek开发高性能算子的核心工具。

此次昇腾版本封装了底层Ascend C指令。DeepSeek称,目前训练中使用的每一个TileLang算子,在昇腾上都有对应的高性能实现。

这项进展的意义,是DeepSeek能够将已经熟悉的研发工具延伸到另一种硬件上,减少为不同平台重复开发的负担。昇腾获得的支持,也更贴近模型团队自身的训练需求。

但编程工具只是其中一环,模型还需要高效执行具体计算,并在多张卡之间交换数据。

因此,此次开放的组件还包括加速矩阵运算的DeepGEMM、处理跨设备通信的DeepEP,以及覆盖向量计算与访存、稀疏注意力,以及用于注意力索引和采样的Top-K选择等操作的TileKernels、FlashMLA和DeepSelect。它们为常见任务提供可复用的实现,让开发者不必逐项从头优化。

“一一对应”也由此有了实际含义。部分项目已经对齐上层接口,例如TileKernels支持同一套Python接口在英伟达GPU与华为NPU上运行,底层实现根据硬件选择。

不过,接口能够复用,性能仍需针对硬件打磨。DeepSeek在公告中感谢华为团队给予“毫无保留的大力支持”,双方围绕128卡超节点共同优化计算与通信,正是为了让这些软件能力在具体系统中发挥作用。

DeepSeek称,多项关键测试用例的性能已接近硬件上限。这些成绩仍属于特定测试条件下的结果,但显示双方的工作已经进入性能深度优化阶段。

此次进展之前,昇腾生态已围绕DeepSeek模型开展多轮适配。

02 从推理服务,逐步进入模型研发

2025年8月,DeepSeek发布V3.1时,解释其UE8M0 FP8设计面向即将发布的下一代国产芯片。虽然没有点名华为,但这一表态说明,国产硬件需求已开始进入模型团队的技术设计考量。

2025年9月29日,DeepSeek-V3.2-Exp发布,引入稀疏注意力机制,并开放相关算子实现。同一天,TileLang-Ascend开源,围绕昇腾建设高级语言开发能力的工作由此公开。

2026年4月24日,V4预览版发布,昇腾适配已延伸至推理和训练侧。开放原子开源基金会披露,相关实践包括推理优化、Ascend C融合算子,以及训练优化和续训练;TileLang-Ascend也发布了V4算子。

此次DeepSeek明确将适配范围对齐自家训练使用的TileLang算子,并将计算与通信组件成套开放,同时披露了与华为围绕昇腾950开展联合优化的进展。

从已发布模型的部署适配,到面向新结构的算子优化,再到此次基础设施组件开放,昇腾对DeepSeek的支持正进一步深入模型研发所需的软件层。

03 扩充算力,需要跨过软件这一关

9月24日,腾讯科技报道,DeepSeek规模为500亿元的第二轮融资已接近结束,但部分审核仍在进行,具体落地时间尚不确定。路透社此前也报道,DeepSeek已聘请中信证券筹备潜在的科创板IPO,上市时间及募资规模尚未确定。

资金可以支持研发和基础设施投入,但新增硬件能否转化为有效算力,还取决于软件适配与运行效率。

据The Information报道,梁文锋在近期投资者会议上表示,DeepSeek将超过70%的算力用于模型训练,留给推理的算力不足30%。这也解释了,为训练所依赖的核心工具增加硬件选择,具有怎样的现实分量。

对DeepSeek而言,昇腾上的工具与组件越完善,未来选择算力平台时,需要重新投入的工程成本就可能越低。对华为而言,与模型团队共同优化,有助于让芯片软件更快跟上模型结构变化,将适配经验用于后续产品。

开源又使这种合作具备向外扩展的可能。DeepSeek表示,希望TileLang昇腾版本能为更多AI芯片建立高可用软件生态起到示范作用。如果其他团队可以复用这些工具,更多国产芯片承接前沿模型的门槛也有望降低。

从组件开源到稳定承担大规模生产任务,仍有工作要做。DeepEP昇腾版还列有开发中的功能,此次公告也未披露V4已在昇腾上完成全流程大规模训练,但可以看出DeepSeek正与华为一起完善一条能够持续支持模型研发的硬件路线。

文章标签DeepSeek芯片
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多