时间:2026 年 9 月 30 日
地点:线上(DeepSeek 官方公众号)
人物:DeepSeek 团队 / 华为昇腾团队
事件详情:DeepSeek 9 月 30 日上午通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应,对标英伟达 CUDA 生态。本次同步开源的 6 大组件包括:DeepGEMM 加速通用矩阵运算;DeepEP 提供高效的大规模跨设备通信;TileKernels 提供数据处理所需的常规向量计算和访存算子;FlashMLA 提供稀疏注意力算子以提升长上下文处理效率;DeepSelect 实现高效的数据筛选。其中 TileLang 昇腾版本对昇腾 Ascend C 底层指令进行封装,提供高级语言编程方式的同时不损失硬件性能,目前 DeepSeek 训练中用到的每一个 TileLang 算子在昇腾上都有对应的高性能实现。在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。
背景:TileLang 是北京大学团队主导开发的 GPU 内核编程语言,构建在 Apache TVM 之上,采用类 Python 的简洁语法,2025 年 1 月 GitHub 开源至今已获 1.9k 标星。TileLang 路线首先在英伟达成熟平台得到验证,已承载 DeepSeek V4 系列模型训练中大部分算子的实现,被 DeepSeek 称为"探索 AGI 新范式、开发高性能算子的核心工具"。本次开源补齐了昇腾平台从单卡计算到 128 卡超节点协作的完整软件栈。DeepSeek 通过公开 Ascend C 与 PTO ISA 底层指令体系,依托昇腾稳定的开放接口完成对接,是国内首个"自有模型厂商 + 自有芯片厂商"完整开源闭环。
影响:DeepSeek 与华为昇腾联合推进基于昇腾 950 的 128 卡超节点方案,对计算与通信进行深度优化。华为向 DeepSeek 提供联合定义的 SuperPoD Flex 与 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络与 256K 卡两层交换 Scale-out 网络,支持超低时延推理与前沿基座模型大规模训练需求。FlashMLA 在昇腾 950 上,预填充阶段稀疏注意力算子最高达到硬件理论峰值的 95%、解码阶段最高 83%;DeepEP 实测互联带宽 Dispatch 375 GB/s、Combine 347 GB/s。基于 EP32 部署策略,DeepSeek-V4.1-Flash offline 推理 TPOT=5ms 时每卡输出 2469 tokens/s,TPOT=10ms 时每卡输出 5102 tokens/s。这标志着英伟达 CUDA 长期构建的软件护城河正受到来自国产软硬协同生态的系统性挑战,对国内 AI 算力自主可控进程具有里程碑意义。
总结:DeepSeek 此次开源不是单点工具的开放,而是从编程语言 TileLang 到计算库 DeepGEMM/FlashMLA、再到分布式通信库 DeepEP 的全栈开源,与英伟达平台一一对应。这让昇腾首次具备了与 CUDA 兼容的"上层模型零成本迁移"能力,是国产 AI 芯片软件生态追赶 CUDA 的关键一步。
参考来源:
1. IT之家:https://www.ithome.com/1/008/604.htm
2. 网易科技:https://www.163.com/tech/article/L82N0RQQ00097U7T.html
3. 新浪财经:https://finance.sina.com.cn/roll/2026-09-30/doc-initqkpm5828931.shtml
4. 腾讯新闻:https://news.qq.com/rain/a/20260930A03LM700
5. 搜狐(新浪科技):https://www.sohu.com/a/1082592735_122014422
6. 网易(深度合作):https://www.163.com/dy/article/L82OCIFH0511FMIQ.html
7. 腾讯凤凰网:https://news.qq.com/rain/a/20260930A03Q7Z00
8. 腾讯驱动中国:https://news.qq.com/rain/a/20260930A03ZWL00







