塔斯娱乐资讯网

老黄兴许做梦都没想到,自己筑了二十年的CUDA高墙,会被一家年轻的中国大模型公司

老黄兴许做梦都没想到,自己筑了二十年的CUDA高墙,会被一家年轻的中国大模型公司,用最干脆利落的方式拆了墙角。
 
国庆节前,DeepSeek做了一个让硅谷摸不着头脑的决定:把面向华为昇腾芯片的一整套开发工具和底层高性能算子,直接公开了源代码。
 
最硬核的地方,就在四个字——一一对应。
 
以前在英伟达显卡上跑的底层计算程序,如今昇腾上全都有了高性能的镜像版本。同一套代码,两边都能跑。
 
这一招出去,国内大厂的反应快得像抢限时优惠:阿里、腾讯加上DeepSeek自己,火速开启了对华为昇腾集群的大规模采购。
 
在AI这行,大家过去常开玩笑:买英伟达的硬件,送的是CUDA;可你真正离不开的,其实是CUDA这个吸铁石般的生态。皮衣黄的护城河,从来不只是几块算力凶猛的显卡,而是全球几百万程序员二十年来攒下的代码惯性。
 
以前想从英伟达换到国产芯片,不亚于把整栋房子推倒重盖——底层重写、算法重调,费时费力还不一定跑得通。
 
可DeepSeek这一刀,砍得极其精准。它不跟你拼硬件制程,而是在软件层直接搞了个"一键搬家"。在AI训练里,调度运算与数据传输的核心程序,行话叫"算子"。
 
英伟达平台上的每一套看家算子,DeepSeek都在昇腾上复刻并优化出了高效版本。
 
为啥说这一刀砍在了命门上?懂行的人都知道,英伟达这二十年的家底,一半在显卡,一半在CUDA。显卡是硬件,CUDA是软件,两头拧在一起,才织成一张谁也绕不开的网。
 
打个比方:显卡好比一条高速公路,CUDA就是路上跑熟了的车队,跑了二十年,司机、修理工、加油站全认这一条道。如今有人告诉你,旁边新修的那条路,跑同样的车,还不收费——你说,这墙还立得住吗?
 
更绝的是,DeepSeek这次没扔出半成品,而是把整套家什都搬了过来:底层编程语言TileLang,行内管它叫"中国版CUDA";矩阵乘法核心库DeepGEMM-Ascend,实测密集矩阵算力利用率最高能到99.8%;专家并行通信库DeepEP-Ascend,数据搬运带宽顶到物理上限的90%以上;再加上FlashMLA、TileKernels、DeepSelect这些看家算子,一共6个项目,从编程语言到通信、到算子,一条链全打通。
 
而且都不是另起炉灶——英伟达那边有啥,昇腾这边就对应有啥,接口都能对上号。
 
最让程序员眼前一亮的,是TileLang这套语言:同一份代码,在英伟达的卡上和华为的NPU上都能跑,写一遍,两边用。
 
过去换芯片等于搬一次家,锅碗瓢盆全得重买;现在等于拿到同一套钥匙,能开两家的门。华为昇腾团队这次也下场帮了忙,两家还合计着一起推进昇腾950的128卡超节点方案。
 
市场的反应,比任何宣传都诚实。今年4月,DeepSeek V4发布,100%跑在华为昇腾上,成了全球头一个彻底脱离CUDA生态的顶级大模型,有报道说,连大洋彼岸的黄仁勋都坐不住了,直呼这是场"灾难"。
 
这之后,字节、阿里、腾讯纷纷找华为谈昇腾950的采购大单;9月又有外媒曝出,DeepSeek自己准备掏约25.6亿美元,订购至少16万颗昇腾950DT芯片,在内蒙古乌兰察布建一座超大型算力中心。
 
往深了说,这一刀砍掉的,是"国产芯片只能将就着用"的老观念。过去总觉得,国产卡性能行不行另说,关键是软件跟不上,程序搬过去就跑不动。
 
现在DeepSeek拿自家最硬核的代码打了个样:不是"凑合能用",而是"用着不赖",同一套代码还能两头跑。软件生态这盘棋一旦活了,硬件的路自然就宽了——以后国产AI的算力命脉,不用再眼巴巴瞅着别人的脸色。
 
有人问,DeepSeek图啥?把看家本事白送出去,不是傻吗?可账要算长远:生态这东西,越多人用越值钱。自己一家用,是独门秘籍;开源出来,成千上万的开发者都来用,昇腾生态就活了,国产算力就起来了——这盘棋,下的是整个行业的未来。
 
老话说,墙高不如路宽。皮衣黄筑了二十年的高墙,这回碰上了愿意把门拆了、招呼大家一起走的人。这道墙还能挡多久,真说不好。