DeepSeek开源昇腾全套工具链:同一套代码同时跑通英伟达与华为芯片

AI资讯19秒前发布 EdgeClaw
0 00

国庆假期前夕,DeepSeek通过官方渠道宣布,将一整套面向华为昇腾芯片的开发工具免费开源,这套工具与其在英伟达平台上使用的版本一一对应。DeepSeek表示,其训练大模型用到的每一段底层计算程序,如今在昇腾芯片上都有了对应的高性能版本。

TileLang:让迁移成本从”重写代码”变成”一次适配”

芯片算力要转化为模型训练能力,离不开大量负责调度运算和数据传输的底层程序,业内称之为”算子”。英伟达CUDA平台推出近二十年,全球数百万开发者在其上积累了海量算子,主流大模型的训练代码多基于它编写,与英伟达硬件深度绑定——企业若改用其他芯片,需要逐一重写并重新调优,这正是国产AI芯片迁移成本居高不下的根源。

本次开源的TileLang提供了另一种思路。这门编程语言由北京大学计算机学院团队主导开发,2025年1月开源,设计目标是:编程简单、同时能达到硬件性能上限,并且不与特定硬件绑定。只要芯片厂商完成一次底层对接,基于TileLang编写的程序即可直接在该芯片上运行。换言之,迁移成本从”企业重写全部代码”转变为”芯片厂商完成一次适配”。

TileLang跨芯片算子生态等距3D概念图,蓝色GPU与绿色NPU通过中立语言层互联

DeepSeek是这一路线的早期采用者,目前其V4系列模型训练中的大部分算子均基于TileLang实现。此次开源的,是TileLang在昇腾上的完整实现,以及与英伟达版本一一对应的五个配套组件,覆盖矩阵运算、长文本处理、多芯片通信等训练核心环节。在软件层面,DeepSeek训练前沿模型所用的代码已可在昇腾平台上运行,无需重写。

昇腾950超节点性能已接近硬件上限

性能方面,DeepSeek与华为共同推进了基于昇腾950的128卡超节点方案,将128块芯片高速互联、作为一个整体协同运算。公开数据显示,面向昇腾950的稀疏注意力算子,读取输入阶段达到410 TFlops,为硬件极限的95%;逐步生成内容阶段达到360 TFlops,为83%。自研通信库实测互联带宽也逼近硬件上限。

这背后是DeepSeek的算力现实。创始人梁文锋曾坦言,公司超过70%的算力用于模型训练,在高端芯片供给受限的情况下,昇腾是现实可得的选择。据彭博社报道,DeepSeek已向华为订购16万颗昇腾950DT芯片,用于内蒙古的1GW数据中心。梁文锋对昇腾950超节点的评价是:在性能和价格上完全可以平替英伟达的GB200和GB300。

昇腾950超节点算力集群场景图,服务器阵列与金色互联光缆汇聚算力核心

国产芯片或首次共享算子生态

比单一平台适配更值得关注的是TileLang所处的位置。它位于模型与芯片之间,不归属于任何一家硬件厂商,芯片厂商只需提供编译后端和底层指令接口,上层基于TileLang编写的算子生态即可复用。昇腾此次开放了Ascend C与底层指令体系,上层算子生态即可复用。

长期以来,国产AI芯片各有各的软件体系,寒武纪、海光、摩尔线程、沐曦等厂商需各自搭建算子生态,开发资源分散,模型厂商每适配一家就是一次新的迁移。若各家芯片共同对接TileLang这样的中立语言层,国产AI芯片有望第一次拥有跨芯片共享的算子生态。目前,摩尔线程、沐曦、算能等厂商均已与TileLang开展适配合作。

算力焦虑下的现实选择

值得注意的是,DeepSeek宣布开源的同一天,华为基于昇腾950的智算集群云服务也在国内正式商用——软件工具的开放与算力供给的落地出现在同一个时间点。软件生态方面,华为于2025年8月宣布昇腾底层软件平台CANN全面开源,据今年9月披露,CANN开源社区中非华为开发者的数量已超过华为开发者。

当然,这套工具链仍面临考验。公开项目文档显示,部分组件功能尚在开发阶段,部分性能测试基于验证版硬件完成;英伟达CUDA平台二十年的生态积累也非一日之功。但至少,国产AI芯片第一次有了打通软件生态的清晰路径。

© 版权声明

相关文章