Article2026/09/04免费内容

自研ASIC的天花板:TPU、Trainium、MTIA能吃掉多少英伟达

超大云自研ASIC能降低内部算力成本并持续侵蚀英伟达份额,但自用边界、软件栈和迭代节奏决定它更像长期折价因子。 聊英伟达的对手,除了AMD,还有一批更隐秘也更值得关注的选手——超大云自己做的AI芯片。Google的TPU、亚马逊的Trainium、Meta的MTIA、微软的Maia。它们和英伟达不在同一个市场…

Course extensionAI产业链投资大逻辑返回课程

聊英伟达的对手,除了AMD,还有一批更隐秘也更值得关注的选手——超大云自己做的AI芯片。Google的TPU、亚马逊的Trainium、Meta的MTIA、微软的Maia。它们和英伟达不在同一个市场上直接竞争,但都在悄悄啃英伟达的份额。

先看规模。

业内估算2026年超大云自研芯片合计部署量约190万颗加速器,相当于英伟达出货量的一个可观比例。TPU v6(Trillium)、MTIA v3已经在谷歌和Meta的生产环境正式跑起来,AWS Trainium3也做到3nm、单卡144GB HBM3E。硬件规格上,这批芯片已经和英伟达在同一个量级。

自研ASIC的逻辑非常简单:

超大云买英伟达GPU要付75%的毛利溢价,如果自己做一颗只服务于自家工作负载的芯片,成本可以砍掉一半以上。就算算上一次性的设计费用、软件栈开发、工程团队,大规模部署之后单位算力成本还是能省下来。所以每一家超大云都有强烈的动机做这件事。

但ASIC也有非常明确的天花板,这是理解这条主线的关键。

第一,ASIC是“自用”的。

它只跑自家框架、自家工作负载,不对外销售。TPU只在Google Cloud内部用,Trainium只在AWS内部用。这意味着它不能形成通用市场,也不能像英伟达那样跨客户、跨场景摊薄开发成本。

第二,ASIC需要自家的软件栈。

TPU用的是XLA、JAX,Trainium有Neuron SDK。这些软件栈只在超大云自家闭环里成熟,超大云工程师能用,外部的AI公司几乎没人碰。这就限制了ASIC的实际使用范围。

第三,ASIC的迭代节奏比GPU慢。

英伟达每年一代新架构,超大云自研芯片一般两到三年一代。因为设计一颗新芯片、量产、部署、调优都要时间。当英伟达每代都翻倍性能的时候,ASIC很容易被拉开身位。

第四,前沿训练还是绕不开英伟达。

超大云自己训练顶级模型时,大部分核心训练任务依然放在英伟达集群上。TPU和MTIA更多用在推理、以及一些相对确定的训练任务上。这是因为前沿训练的实验性极强,需要CUDA生态里丰富的调试和优化工具,自研ASIC生态还没到这一步。

所以ASIC对英伟达是“稳定失血”,不是“颠覆性替代”。它会在推理、以及超大云自用训练里,一点一点吃掉英伟达的份额,可能长期把英伟达的市占从80%压到60%甚至更低。但短期内它不会把英伟达打下神坛,因为CUDA生态的普适性、迭代速度、外部市场规模都不是超大云自研能覆盖的。

这对投资者的启示是:ASIC是英伟达估值的长期折价因子,不是短期崩盘因子。

看这条线索,该关注的信号是自研ASIC在超大云内部的部署比例——如果Google内部TPU占比从今天的一半冲到八成,或者AWS Trainium的推理份额过半,那才是真正的拐点。

在此之前,英伟达依然是这个市场的定价权中枢。