老黄恐怕怎么也没料到,自己垒了二十年的CUDA高墙,会被一家年轻的中国大模型厂商用最干脆的方式给撬了墙角。
国庆假期前,DeepSeek做了一个让硅谷摸不清头绪的决定:把适配华为昇腾芯片的一整套开发工具与底层高性能算子,直接全开源了。
DeepSeek这次一口气放出六个GitHub开源项目,从TileLang高级语言编译工具,到DeepGEMM-Ascend矩阵计算核心库,再到分布式通信库、高性能算子集合,整条开发链路从头到尾全覆盖。
更实在的是,这套东西不是实验室里的演示品,是实打实经过工业级验证的落地版本。
换句话说,任何开发者拿到这套工具,不用再从零开始踩坑改代码,直接就能在昇腾芯片上高效率跑通大模型训练和推理。
放在几年前,这是很多从业者想都不敢想的局面。业内人都清楚,CUDA能横行二十年,靠的从来不是芯片性能遥遥领先,而是它织了一张密不透风的生态网。
学生从入门AI开始就学CUDA,工程师写算子、调性能都用CUDA的工具链,十几年的代码、经验、人才全都绑定在这套体系里。
换一款芯片?相当于让老厨师扔掉用了半辈子的刀具厨具,从头学一套新的操作逻辑,时间成本、人力成本高到绝大多数团队都不愿尝试。
华为的昇腾走到今天,硬件性能早已追了上来,自己的计算架构、开发框架也都打磨成熟,但生态这件事,从来不是靠一家厂商就能快速做成的。
每一家大模型公司,每一个AI应用团队,要想用昇腾跑业务,都得自己抽调人手改代码、调算子、磨性能,踩一大堆没人走过的坑。很多团队不是不想支持国产算力,是项目进度等不起,研发成本耗不起。
DeepSeek这一手,最妙的地方就是没按行业老规矩出牌。它没下场做芯片,也没喊着要对标谁、替代谁,就是站在一个大模型厂商的角度,把自己天天跟算力打交道踩出来的全套工程经验,直接公开给全行业免费用。
很多人第一反应是“这是帮华为补生态”,其实这事的影响远不止于此。CUDA的高墙,本质上是“工具链的垄断”——芯片厂商定标准,全行业跟着走,后来者就算硬件做得再好,没有顺手的工具和成熟的算子库,也只能在生态墙外打转。
DeepSeek这步棋,相当于直接把“做底层开发工具”这件事,从芯片厂商的专属护城河,变成了全行业可以共建共享的公共资源。
今天它能把昇腾的全栈适配工具做透开源,明天这套框架就能快速移植到其他国产算力芯片上。生态的门槛一旦被撕开一道口子,就再也合不上了。
这也难怪硅谷那边摸不清路数。英伟达玩了二十年的玩法,都是“硬件为主,生态锁客”,AMD、英特尔追了这么多年,也都是跟着这个路子,拼硬件性能,搭自己的工具链。
从来没人想过,会有一家做大模型的公司跳出来,干了本该芯片厂商干的活,干完还直接免费公开给所有人用。
但这恰恰是AI行业发展到今天的必然。早年算力稀缺,芯片厂商说了算,生态自然围着硬件转;现在大模型和应用成了核心,谁最懂算力怎么用、哪里要优化,谁做出来的工具就最接地气。
DeepSeek本身就是国内顶级的大模型算力用户,天天跟训练推理的性能瓶颈打交道,知道哪里最卡效率,哪里最需要优化,做出来的工具自然最贴合实际业务需求。这种从应用端反向定义底层工具的思路,本身就是对传统芯片生态逻辑的一次松动。
说到底,这次开源算不上什么“颠覆CUDA”的大事件,却实实在在捅破了行业里的一层窗户纸:AI算力的真正壁垒,从来都不是硬件本身,而是日积月累的工程经验和生态惯性。当有人愿意把最值钱的落地经验拿出来共享,那堵攒了二十年的高墙,就不再是不可逾越的天堑。
没有高调的口号,没有刻意的对标,就安安静静把一套能用、好用的工具扔出来,让全行业都能更低成本地用上国产算力。这种干脆利落的做事风格,反而最有力量。CUDA的墙角,就这么被悄悄撬开了一块,而接下来,注定会有越来越多的从业者,顺着这个缺口走进去。

评论列表