谷歌正在用推理芯片凿穿英伟达的城墙

2026.09.08 07:19
SemiAnalysis 最新评测显示,谷歌 TPUv7 Ironwood 在推理场景下实现了最高 50% 的每美元性能优势。随着 TorchTPU 开源、客户持续涌入、以及从自用到外售的战略转身,谷歌正在用 TCO 优势和开放软件栈同时冲击英伟达的两大支柱:性能领先与 CUDA 生态锁定。

谷歌花了十多年在自己内部构筑了一个 TPU 帝国。搜索、广告、YouTube、每一代 Gemini,全都跑在谷歌自研的芯片上。但行业真正关心的问题从来不是“谷歌自己用得好不好”,而是“别人能不能用得上”。

2026年9月,SemiAnalysis 发布了 TPUv7 Ironwood 在 InferenceX 上的首个第三方推理评测。答案正在变得清晰,而且比大多数人预期的要快得多。

Ironwood 的经济账:每美元性能高出 50%

SemiAnalysis 的评测用 Qwen3.5 397B FP8 做基准,在等同条件下对比了 Ironwood 与 NVIDIA B200 和 B300。结果如下:在 100 tokens/s/user 的交互速度下,Ironwood 每百万 token 的综合成本约 $0.181,而 B200 约 $0.222,B300 约 $0.276。Ironwood 比 B200 低 19%,比 B300 低 34%。

进一步放大到全性能曲线,在 FP8 精度下,Ironwood 相比 Blackwell 系列的每美元性能优势最高可达 50%。

不过这个优势并非没有边界。Ironwood 目前不支持原生 FP4 计算,在 FP4 场景下 NVIDIA 的 Blackwell 仍能保持领先。但谷歌已经明确表示,下一代的 TPUv8i(代号 Zebrafish)将原生支持 FP4,目标直指 NVIDIA Rubin NVL72。

Ironwood 的单芯片规格与 B200 基本在同一量级:4.6 petaFLOPS 峰值 FP8 算力、192GB HBM3e 内存、7.4 TB/s 内存带宽。NVIDIA 在单芯片互联带宽上领先(14.4 Tbps NVLink vs 9.6 Tbps ICI),但谷歌的优势在集群层面:一个 Ironwood SuperPod 可扩展至 9,216 颗芯片,提供 42.5 exaFLOPS 聚合算力。

真正的差距不在芯片规格表里,而在总拥有成本(TCO)。谷歌的垂直整合——从芯片设计到系统集成、液冷基础设施到软件栈——使得 Ironwood 的每芯片成本显著低于 NVIDIA 卖给超大规模客户的 GPU 定价。

从“自用”到“外售”:一个十年战略转身

2026年4月,Alphabet CEO Sundar Pichai 在 Q1 财报电话会上做了一件谷歌从未做过的事:宣布将 TPU 芯片直接销售给外部客户,部署在客户自有的数据中心内。CFO Anat Ashkenazi 随后补充,2026 年将有小部分外售收入入账,大部分将在 2027 年兑现。

这个转身并非心血来潮。客户名单已经相当有分量。

Anthropic 是最大的 TPU 外部用户。该公司的 ARR 在 2026 年内从约 $90 亿飙升至超过 $440 亿(年化 run-rate),承诺部署超过 100 万颗 TPU,其中约 40 万颗直接购买、60 万颗通过 GCP 租赁,总合同价值超过千亿美元级别。

Meta 据 The Information 报道,正在与谷歌谈判价值数十亿美元的 TPU 部署协议,计划 2027 年起在自有数据中心部署 TPU;2026 年可能先通过 GCP 租赁开始使用。

OpenAI 也在测试谷歌 TPU,尽管目前表示没有正式使用计划。此外,Salesforce 的 Einstein 工作负载已部分运行在 Ironwood 上。

变现策略从“锁定留用”转向“规模占领”。谷歌过去把 TPU 视为内部业务的竞争壁垒——更低的搜索成本、更高的 YouTube 推荐效率。但现在,它选择将这一优势货币化,哪怕这意味着帮助潜在竞争对手降低推理成本。

“芯片即服务”模式正在模糊硬件和云服务的边界。谷歌提供的是混合路径:客户既可以通过 GCP 租赁 TPU 算力,也可以直接购买芯片部署在自己的数据中心。这种灵活性是 NVIDIA 目前无法直接对标的,因为 NVIDIA 的客户买了 GPU 还要买网络、买集群方案,而谷歌可以提供一个近乎交钥匙的解决方案。

Anthropic 效应正在产生市场示范价值。当一个年化收入超过 $440 亿的 AI 公司用 TPU 跑核心推理业务时,“TPU 只能用于谷歌内部产品”的说法被彻底击穿。Anthropic 本身也凭借 Claude 系列在 2026 年实现了爆炸性增长,其企业级 LLM API 市场份额据行业估算已在 2026 年中首次超越 OpenAI。

TorchTPU:攻破 CUDA 城墙的攻城锤

外界的长期质疑——也是谷歌 TPU 外部化最大的质疑——始终是:硬件再好,软件生态不够,客户凭什么买单?

之前的回答一直是 JAX 和 XLA。这两个框架在谷歌内部运行了数百万个 TPU 芯片的训练和推理,性能无可挑剔。但对于一个习惯了 PyTorch + CUDA 生态的外部开发者来说,迁移到 JAX 意味着重新学习整个开发范式、重写所有代码、重新调试性能。这不是“换一个供应商”,而是“换一整套做事方式”。

TorchTPU 的出现正在改写这个逻辑。

TorchTPU 是谷歌新一代的 TPU 外部推理软件栈,将取代即将被弃用的 TorchAX。当前处于 private beta 阶段,预计 2026 年 10 月在 PyTorch Conference 期间开源。它的核心意义在于:让开发者在 PyTorch 中写的模型代码可以在 TPU 上直接运行,无需迁移到 JAX。

更关键的是,谷歌团队正在与 Inferact、RadixArk、Red Hat 等社区伙伴紧密合作,为 vLLM 和 SGLang——两大主流开源推理引擎——构建原生的 TorchTPU backend。

这对行业的冲击在于:vLLM 和 SGLang 目前的开箱即用支持以 NVIDIA 为绝对第一优先级,AMD 仅作为次优支持。一旦 TorchTPU 稳定到足以被 vLLM/SGLang 维护者列入 day-0 支持列表——SemiAnalysis 预计这一时间点已不遥远——TPU 将成为第三个主流推理硬件平台。

SemiAnalysis 在文章中特别指出了谷歌与 AMD 在软件工程文化上的关键差异:“AMD 仍然在学习如何建立测试优先的软件文化,而谷歌拥有数十年的高质量软件工程经验和极其成熟的质量驱动文化。”

这意味着 TorchTPU 的外部软件栈成熟速度可能会远超行业预期。

推理的黄金时代:为什么时间站在谷歌这边

TPU 外部化之所以“full steam ahead”,大背景是全球 AI 算力需求结构正在发生根本性转变。

麦肯锡的数据中心需求模型预测:2026 年 AI 训练和推理各占约 31.2 GW 的数据中心容量;到 2027 年,推理将首次超过训练;到 2030 年,推理将占据 93.3 GW,训练占 62.2 GW,推理与训练的比例达到 60:40。

英伟达自己也看到了这一点,其 Blackwell 和 Rubin 系列对推理场景的持续优化就是明证。但谷歌的 TPU 从第一代设计起就是为推理深度优化的(尽管后来的 v3、v4、v5p 在训练上也表现不俗)。Ironwood 更是谷歌明确命名的“inference-first”芯片——推理优先,训练次之。

当整个行业正在从“谁的训练集群最大”转向“谁的推理成本最低”时,谷歌的 TPU 战略恰好站在了历史的顺风侧。

CUDA 的护城河还能撑多久?

NVIDIA 在 2026 财年的数据中心收入达到 $1,937 亿,仍然控制着约 80% 的 AI 加速器市场。其 Q4 FY2026 单季收入 $681 亿,其中数据中心 $623 亿,同比增长 75%。这些数字说明 NVIDIA 的基本盘远未被撼动。

但结构性的风险已经显现。

来自四家超大规模客户的收入贡献了 NVIDIA 数据中心业务的约 40%,而这四家——谷歌、亚马逊、微软、Meta——全部在自研 AI 芯片。博通的定制 AI ASIC 收入在 FY2025 已达到约 $200 亿,以 $730 亿的合同积压量说明超大规模客户正在加速摆脱对 NVIDIA 单芯片的依赖。

对 NVIDIA 最致命的打击或许不是性能被超越,而是定价权被侵蚀。一旦谷歌的 TPU 在推理市场建立起一个有竞争力的价格锚点,NVIDIA 原本建立在 75% 以上毛利率之上的定价模型将面临结构性压力。

当然,谷歌 TPU 外部化的风险同样存在。

Anthropic 一家占据了 TPU 外部出货量的绝对多数,这既是示范效应也是脆弱性。Ironwood 没有原生 FP4,在低精度推理场景中处于劣势,而 TPUv8i 要到 2027 年底才能上市。TorchTPU 尚在 beta 阶段,距离 vLLM/SGLang 原生 day-0 支持仍需数月到一年的打磨。TPU 的制造高度依赖 Broadcom 与 TSMC,供应链集中度意味着产能和地缘政治风险。

结语

TPU 外部化不是一个“会不会发生”的问题,而是一个“多快发生”的问题。谷歌花了十多年把自研芯片变成了世界上最高效的内部推理引擎之一。现在,它选择把这些引擎卖给曾经只能用 NVIDIA 的人。

英伟达在 AI 芯片的统治地位建立在两个支柱上:性能领先和 CUDA 生态锁定。TPU 正在用垂直整合的 TCO 优势撬动第一根支柱,用 TorchTPU 的开放路径冲击第二根支柱。

两根支柱不会同时倒塌。但裂缝已经出现,而且正在快速扩大。

作品声明:内容由AI生成