剑指英伟达CUDA!DeepSeek开源华为昇腾全套组件

信息来自 财联社 | 科技创新 | 2026-09-30 21:01:14

此次开源的核心是TileLang昇腾版本,它对昇腾底层指令进行了封装,让开发者能用更简单的高级语言编程,同时不损失硬件性能,目标是成为对标英伟达CUDA语言的“工具箱”。

一方面,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑。

另一方面,相对于其它同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

这种“芯模协同”的深度,是组件能达到接近硬件上限性能的关键。相关技术成果也已在华为的CANN社区同步开源,形成了双向的生态共建。

《科创板日报》记者获悉,华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,可以支持超低时延推理和前沿基座模型的大规模训练的需求。

基于全互联的UBL128超节点,昇腾提供了ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。Deepseek团队开发了高性能DeepEP通信库,涵盖EP/CP/PP/FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到Dispatch 375GB/s、Combine 347 GB/s的通信性能,接近硬件上限。

此外,DeepSeek还开源了五个关键的计算与通信组件,覆盖了模型训练的核心环节:DeepGEMM加速通用矩阵运算;DeepEP提供高效的大规模跨设备通信;TileKernels提供数据处理所需的常规向量计算和访存算子;FlashMLA提供稀疏注意力算子,提升长上下文处理效率;DeepSelect则实现了高效的数据筛选。

在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。多项关键测试显示,这些组件的计算与通信性能均已接近硬件上限。

这次开源的战略意义,远大于其技术细节。

业内人士王敏坚告诉《科创板日报》记者,过去三年,中国AI芯片的真正瓶颈从来不在晶体管,而在软件。英伟达的护城河不是芯片算力,而是CUDA十八年积累的软件生态,数百万开发者、无数调优过的算子、以及“写一次到处能跑”的开发体验。国产芯片算力规格一次次逼近,客户却总在最后一步犹豫:迁移成本太高。

DeepSeek在此次公告中提到,DeepSeek训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。这句表述,翻译成产业语言就是:训练DeepSeek级别的前沿模型,从此在软件栈层面不再唯一依赖英伟达。

王敏坚表示,对国产芯片而言,TileLang的战略价值在于换轨,与其在CUDA的主场上追模拟生态,不如在更高一层,对硬件中立的算子语言建立新标准。算子写在TileLang里,后端可以指向英伟达、昇腾,也可以指向任何愿意实现编译后端的AI芯片。

有券商研报早在去年就指出:TileLang或将解决国产AI芯片高性能计算平台之间接口互不兼容的问题,降低大模型训练与推理代码的迁移成本。

根据公开资料,TileLang是一款由北京大学计算机学院团队主导开发的开源高性能AI算子编程语言,属于领域特定语言(DSL),于2025年1月开源。其核心设计基于“Tile”(张量分块)抽象,采用类Python的声明式语法,开发者可用接近数学公式的形式描述计算意图,由编译器自动完成循环优化、内存调度等底层硬件适配,旨在降低AI算子开发门槛并实现“一次编写,多架构运行”。

TileLang于2025年9月应用于DeepSeek-V3.2-Exp等大模型研发,并与华为昇腾、摩尔线程、算能、沐曦等硬件厂商达成适配合作。

在华为全联接大会2025的开发者日上,TileLang团队成员董宇骐介绍了TileLang实现FlashAttention算子开发,代码量从500+行减少至80行,并保持了与官方版本持平的性能。

这次DeepSeek公告中另一句值得细读的话:TileLang昇腾版本作为一个开源工作,希望能对更多AI芯片建立高可用软件生态起到示范作用。

此外,虽然软件优化能逼近硬件上限,但硬件本身的算力天花板仍是基础。昇腾芯片的持续迭代能力,将决定这套软件生态最终能支撑多大的模型和场景。而DeepSeek的示范能否带动更多模型厂商跟进,则是生态能否真正繁荣的关键。

免责声明:本文信息来自 财联社 平台,仅供参考。如有侵权,请及时联系我们删除。

评论交流

0
支持回复和点赞