Article2026/09/04免费内容

CUDA不是一个软件,是一道护城河——为什么AMD追得这么慢

CUDA是英伟达用近二十年建立的完整开发生态。AMD硬件并不弱,但迁移成本、工具链成熟度与社区锁定让追赶远比规格竞争困难。 聊英伟达,绕不开CUDA。但绝大多数人对CUDA的理解都停在“英伟达的编程语言”这一层。这个理解不算错,但严重低估了它的分量。 CUDA不是一个软件,它是英伟达花了将近二十年时间,在GP…

Course extensionAI产业链投资大逻辑返回课程

聊英伟达,绕不开CUDA。但绝大多数人对CUDA的理解都停在“英伟达的编程语言”这一层。这个理解不算错,但严重低估了它的分量。

CUDA不是一个软件,它是英伟达花了将近二十年时间,在GPU硬件之上垒起来的一整座生态。今天全世界几乎所有跑在GPU上的AI训练代码,都是围绕CUDA写的。这道墙就是英伟达的真正护城河。

先看事实。

2026年英伟达在AI加速器市场的份额大约是80%,AMD大约7%到8%,剩下的是超大云自研芯片。

AMD的MI300X硬件规格并不差,单卡FP8算力接近英伟达同代产品,HBM容量甚至更大,价格还只有一半。按理说这是一个非常好的产品。但市场份额就是上不去。为什么?

答案就一个词:软件生态。

CUDA有一整套工具链——cuDNN、cuBLAS、TensorRT、NCCL、Nsight——PyTorch、TensorFlow、JAX这些主流框架的底层调用全部深度绑定CUDA。研究员写代码是“import torch”,背后跑的是CUDA;工程师做部署用的是TensorRT,底下还是CUDA。

这套生态的成熟度,来自英伟达从2007年开始持续投入的将近二十年积累。AMD的对标产品叫ROCm,起步晚了十年,虽然在快速追赶,但业内的普遍反馈仍然是:稳定性、兼容性、工具链完整度和CUDA差一个身位。

这个差距的成本是实打实的。

一个大模型团队要从英伟达迁移到AMD,理论上代码要重写一遍,调优过程要重来一遍,分布式训练的通信库要换一套,遇到bug没有社区可以问。就算AMD硬件便宜一半,人力成本和时间成本一算,大部分团队宁愿多花钱买英伟达。

这就是软件生态的锁定效应——它不是技术不能替代,而是替代的成本太高、太不划算。

那AMD为什么还能拿到8%的份额?

因为在推理端,尤其是超大规模玩家自建集群时,他们有工程能力自己去啃ROCm,追求硬件性价比。

Meta、微软的部分推理集群就在用MI300X。但训练端,尤其是前沿大模型训练,几乎全在英伟达上。SemiAnalysis有一组数据显示,AMD在AI训练里的实际部署占比远低于其名义份额。

CUDA的另一个作用是让英伟达能持续定义标准。

英伟达在2026年推出的NVLink Fusion,把NVLink开放给Marvell这些定制芯片厂,本质上就是在扩大CUDA生态的边界——让别人的加速器也能进这个圈,但游戏规则还是英伟达定。

这就是护城河的进阶用法:不是把敌人拒之门外,而是把敌人变成自己生态的一部分。

看清CUDA这道墙,你就能理解为什么英伟达估值贵、还敢继续贵。它卖的不只是硬件,是一整套“你离不开的开发环境”。这也是为什么二级市场上“AMD追平英伟达”这种叙事,每半年都会被讲一遍,但每次都会被市场用价格打回原形。

硬件规格可以复制,二十年的生态积累不行。