9月30日,DeepSeek宣布开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、计算库和分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。据行业媒体和机构分析认为,这是国产大模型企业将自研底层算子工具链系统性迁移至国产算力平台的重要进展。此举降低开发者迁移门槛,补齐国产算力软件生态短板,推动国产AI算力从单点推理适配向训练侧、系统级软件栈延伸。
技术层面,TileLang昇腾版本对昇腾Ascend C编程接口进行封装,提供高级语言编程方式同时不损失硬件性能。据DeepSeek介绍,其训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。计算与通信组件方面,DeepGEMM加速通用矩阵运算,DeepEP提供大规模跨设备通信能力并支持MoE场景下的专家并行通信,TileKernels提供向量计算与访存算子,FlashMLA优化长上下文处理,DeepSelect实现高效数据筛选。
DeepSeek表示,华为团队在研发过程中提供了深度技术支持,双方正共同推进基于昇腾950的128卡超节点方案,并深度优化计算与通信。这意味着双方合作已从模型推理适配深入到训练侧底层优化,超节点方案代表国产算力竞争正从单卡性能转向系统级交付能力。
DeepSeek此举的战略背景是英伟达CUDA生态长期构筑的行业壁垒。据国泰海通证券研报,CUDA是英伟达开发的加速计算平台,截至2025年已汇聚600万名开发者,涵盖超400个库、600个AI模型、3700个GPU加速应用,英伟达服务器GPU市占率约97%。CUDA经过近20年积累,已形成完整软件栈,深度绑定全球数百万开发者与主流深度学习框架,迁移成本高昂。DeepSeek此次开源的基础组件,正是在编译器层和核心算子层,打造对标CUDA开发范式的系统性算子解决方案。
事实上,国产大模型适配国产算力已成为行业趋势,但训练侧的系统性适配仍是当前主要短板。智谱GLM-5.1于2026年4月发布当天上线华为云,据华为云披露,在昇腾算力上实现Layer级MOE绝对均衡,整体吞吐提升30%,摩尔线程同期在其MTT S5000上完成适配,提供推理部署和训练复现全流程支持。据美团官方技术博客披露,LongCat-2.0训练峰值规模超过5万张国产算力卡,华为昇腾、摩尔线程、沐曦等完成推理适配。国产大模型在昇腾平台的适配正从后补式迁移走向Day-0原生适配,DeepSeek此次开源正是针对训练侧短板的系统性补强。
近期,DeepSeek在模型、工具和基础设施上连续出手。9月10日发布V4.1-Flash,性能超越V4 Pro并支持多模态;9月19日联合清华发布DSec论文,公开Agent训练沙箱设施;9月25日至29日发布Harness桌面端预览版,提供Windows和macOS安装包,以插件组合Agent能力,内置38条模型供应商接入路由,国产厂商约占四成。这标志DeepSeek正式加入智能体入口竞争,竞争焦点从模型性能和API价格转向桌面入口、工具接口与对话管理权。
在技术和产品之外,DeepSeek资本化进程也在加速。据财联社报道,今年6月DeepSeek完成首轮约510亿元外部融资,投后估值接近4000亿元,腾讯、宁德时代等参与,为国内AI行业迄今规模最大的一轮融资。据The Information消息,公司年化营收运行率已达10亿美元,较数月前翻倍有余,并计划10月底前完成第二轮融资。据路透社消息,公司已聘请中信证券筹备科创板IPO,计划年内启动流程。上述消息均未获公司官方确认。
DeepSeek此次开源有望改善国产算力训练侧长期滞后的格局。若昇腾950超节点量产与集群稳定性验证顺利,国产算力芯片、超节点及配套软件生态有望加速放量,产业链或迎来业绩兑现期,但产业落地仍存在不确定性。
封面图片:公司官网







