DeepSeek 宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,并明确「所有组件与此前面向英伟达平台的开源组件一一对应」。
这是 DeepSeek 首次以官方口径确认,昇腾平台已能完整承载训练算子栈。该公告可以对应上周流出的最新投资人闭门会消息,梁文锋表示采用更多国产芯片训练大模型是「押注最大的方向之一」,并预计华为最早于今年第四季度向 DeepSeek 交付用于模型训练的芯片。
2025 年 9 月 V3.2-Exp 发布时,官方公告对 TileLang 的定位是:「团队使用了高级语言 TileLang 进行快速原型开发 …… 在最后阶段,以 TileLang 作为精度基线,逐步使用底层语言实现更高效的版本」。
彼时 TileLang 是原型与基线工具,最终生产版本仍以 CUDA 重写。本次公告则称 TileLang 已「承载 V4 系列模型训练中大部分算子的实现」。
口径的变化证明 TileLang 已从原型工具转变为生产工具。在 DeepSeek 的工程体系中,昇腾版并非移植旁支,而是与英伟达版平行的正式后端。
该事件首先冲击的就是英伟达 CUDA 的软件生态,此前主流模型与算子库的新算子长期以 CUDA 为默认首发目标,这一规则具有自我强化性。
黄仁勋在今年4月接受 Dwarkesh Patel 播客专访时曾表示过担忧:
「假设 DeepSeek 是针对华为优化的,针对他们的架构化了,那就会让我们处于劣势。如果 DeepSeek 先在华为平台上发布,那对美国来说将是灾难性的。」
要注意的是,昇腾目前承担的是「当前一代模型」的训练与生态共建,而非对英伟达算力的整体替代。
CUDA 依然是最成熟的生态,但在顶级开源模型的训练栈中,有了 CUDA 之外的第二条被公开验证的路径,并且成为了开源资产。
总结下 DeepSeek 与华为适配的大致过程:
2024年年底,梁文锋赴广州与华为团队会面,讨论将 DeepSeek 新一代大模型部署至昇腾超节点,并提出昇腾 A3 SuperPoD 性能达到 100 PFLOPS 的要求。
2025年1月,TileLang 由北大团队在 GitHub 开源。
2025年春节后,华为组织会战适配 DeepSeek,应对 R1 上线后的流量洪峰。
2025年8月,DeepSeek V3.1 发布,采用 UE8M0 FP8 缩放格式训练,宣布面向即将发布的下一代国产芯片而设计。
2025年9月,华为全联接大会公布昇腾 950 系列及 Atlas 950/960 超节点路线图。
2025年9月底,DeepSeek V3.2-Exp 发布,首次开源 TileLang 与 CUDA 双版本算子。华为昇腾、寒武纪、海光完成 Day 0 适配,昇腾方面称已实现 TileLang 的 Sparse Flash Attention 与 Lightning Indexer 算子开发。
2026年4月,V4 系列发布并开源,华为官宣昇腾超节点全系支持。
DeepSeek开源昇腾基础组件
