群发资讯网

黄仁勋筑了二十年的CUDA高墙,被DeepSeek用“四个字”凿穿了 “一一对应

黄仁勋筑了二十年的CUDA高墙,被DeepSeek用“四个字”凿穿了
“一一对应。”国庆前夕,DeepSeek把面向华为昇腾芯片的全套底层工具链直接开源了,所有组件,与英伟达平台的开源组件一一对应。
 
什么意思?
 
以前你在英伟达显卡上跑的底层计算程序,现在昇腾上全都有了高性能的镜像版本,同一套代码,两边都能跑。
 
这招一出,国内大厂的反应比抢限量球鞋还快,路透社报道,字节跳动、腾讯、阿里在DeepSeek V4发布后迅速接触华为,大规模采购昇腾950芯片,阿里云百炼平台在V4发布当天就上线了服务,腾讯云也同步跟进。
 
CUDA到底是什么?
很多人以为CUDA是一个“编程语言”,这个理解窄了。
 
CUDA真正厉害的地方,是英伟达花了近二十年搭起来的一整套软件体系:底层的编译器、中间经过极致优化的计算库、上层无数开发者写好的代码和调试工具,企业一旦用上CUDA,数百万行代码、工程师熟悉的调试方法、跑了几年的工作流程,全绑在这上面了。
 
你想换芯片?可以,但你的代码得重写,你的团队得重新学,你的模型得重新调,换芯片的成本,从来不在芯片本身。
 
这就是英伟达真正的护城河,芯片参数可以追,制程可以迭代,但软件生态的迁移成本,是实打实的墙。
 
DeepSeek干了什么?
DeepSeek用的是TileLang——一套由北京大学计算机学院团队主导开发的高性能编程语言,它的核心逻辑很简单:让开发者用高级语言写代码,底层自动适配不同芯片,而且不牺牲性能。
 
这套路线先在英伟达平台跑通了,DeepSeek V4系列模型训练中大部分算子,都是用TileLang实现的。
 
然后,他们把昇腾版本也做了出来,训练中用到的每一个TileLang算子,昇腾上都有对应的高性能实现。
 
这意味着什么?开发者用同一套Python接口,程序自动选择跑在英伟达GPU还是华为NPU上。 换芯片,不用重写代码。
 
同步开源的还有五个核心组件:DeepGEMM加速矩阵运算,DeepEP负责跨设备通信,TileKernels处理向量计算,FlashMLA优化稀疏注意力,DeepSelect做数据筛选。多项测试中,这些组件的计算和通信性能已经接近硬件理论上限。
 
FlashMLA在昇腾950上的实测数据:预填充阶段稀疏注意力性能达到硬件理论峰值的95%,解码阶段达到83%。
 
2026年1月,美国商务部修改了半导体出口许可政策,允许英伟达H200等芯片以“逐案审查”方式出口中国。

听起来像放松了?看看条件:出口商必须证明不会减少美国客户可用的全球半导体产能,中国买家必须通过客户筛查,产品必须在美国完成独立第三方性能与安全测试。
 
说白了,卖给你的芯片,得先确保美国自己够用,还得让你接受“安全审查”。
 
与此同时,英伟达在华先进AI芯片市场份额已经从95%跌到几乎归零。
 
DeepSeek这次开源,时间点卡得很准。
 
真正的替代,不是把英伟达的芯片换成昇腾的芯片,真正的替代,是让开发者感觉不到自己换了芯片。
 
DeepSeek做的事情,是把“换芯片”这件事的技术门槛,降到了接近零,同一套代码,同一组API,开发者不需要关心底层跑的是谁的硬件。
 
这才是CUDA最害怕的东西,CUDA的锁死效应,建立在“迁移太麻烦”之上,如果迁移不麻烦了,锁就松了。
 
当然,我也不会说CUDA明天就崩,英伟达二十年的积累不是白给的,验证工具、调试生态、开发者社区的惯性,短期内没人能完全替代,而且华为昇腾950的产能受限于制造设备,短期内供不应求。
 
但方向已经变了。
 
黄仁勋真正该担心的,不是华为的芯片算力追上了多少,是DeepSeek让开发者意识到:原来换芯片,可以不用那么痛。