AMD 倒贴钱,CUDA 护城河被 AI 自己拆了?

2026.07.25 09:25
SemiAnalysis 最新报告揭示,AMD 通过高达 105% 的股权返点折扣,让 OpenAI 和 Meta 的每百万 Token 推理成本变为负数。但 Helios 机架面临生产爬坡困境,AMD 内部开发集群不足制约软件进步。AI 编程 Agent 正在自动填平 CUDA 护城河,AMD 能否抓住这一窗口期?

SemiAnalysis 团队在过去几个月里,是 AMD 软件栈最大的 Bug 提交者。他们提交的 Bug 报告,需要 AMD 几十名工程师排队处理。这个全球最知名的半导体分析机构,去年给 AMD 在 AI 加速器赛道上的生存概率打了零分。

但就在 2026 年 7 月的 Advancing AI 大会前后,他们改口了。

不是零分,不是“略有希望”,而是“只要解决两个风险,AMD 有极大机会成功”。这个判断的转变,不是因为 AMD 突然发布了什么碾压级别的硬件——MI455X 的纸面参数确实惊艳,但真正让 SemiAnalysis 改变看法的,是这家公司终于开始认真对待软件了。而他们提供的证据中,最令人瞠目结舌的一条是:AMD 正在通过金融工程手段,给 OpenAI 和 Meta 提供接近 105% 的股权返点折扣。

换句话说,AMD 等于在倒贴钱让客户买自己的算力。

现象层:Advancing AI 2026,AMD 亮出了什么

2026 年 7 月 22 日至 23 日,AMD 在 Advancing AI 2026 上亮出了自己的全部底牌。CEO 苏姿丰一口气发布了 Zen 6 Venice 处理器、Instinct MI400 系列加速器,以及名为 Helios 的整机架系统。

MI400 系列的旗舰 MI455X 参数令人印象深刻:基于 CDNA 5 架构,320 亿晶体管,TSMC 2nm 工艺,432 GB HBM4 内存,每颗 GPU 峰值带宽 19.6 TB/s,提供 40 PFLOPS FP4 推理性能。每颗芯片的 HBM 容量超过 NVIDIA Rubin 的 288 GB,这是 AMD 目前最明确的硬件优势。更大的显存意味着在推理超大模型时,不需要跨卡拆分,系统复杂度和互联开销都更低。

但真正的焦点是 Helios——AMD 的第一个整机架系统。72 颗 MI455X 组成一柜,单柜提供 2.9 exaFLOPS FP4 算力和 31 TB HBM4 内存,能效比上一代提升 2.3 倍。这直接对标 NVIDIA GB300 NVL72 的整机架架构。AMD 选择了一条和 NVIDIA 相同的路线:AI 前沿训练和推理的竞争,已经不再是芯片对芯片,而是整机架对整机架。

几乎同时,AMD 宣布了一系列重磅客户合作。Anthropic 公开承诺部署高达 2 GW 的 AMD Instinct MI450 系列 GPU,首批 1 GW 在 2027 年上半年启动。AMD 同时宣布向 Anthropic 战略投资高达 50 亿美元。双方将联合利用 Claude 来优化 AMD 的 ROCm 软件栈——这相当于让 AI 模型公司反过来帮助硬件厂商优化软件栈,此前在 NVIDIA 的生态体系中几乎不可想象。

微软在 2023 年因 MI300X 的 HBM 可靠性和软件质量问题放弃了 AMD 方案,跳过了 MI325X 和 MI355X 两代产品。但如今微软宣布将在 Azure 上大规模部署 MI455X Helios。SemiAnalysis 认为,这些微软购买的 MI455X 机架,最终客户实际上就是 OpenAI。

更早之前,Meta 已经宣布将在 2026 年下半年部署 Helios 机架,如今 Meta 100% 的 Llama 405B 推理负载已运行在 MI300X 上。OpenAI 签下了跨多代产品的 6 GW 采购协议,并获得了高达 1.6 亿股 AMD 股票的认股权证,行权价为 0.01 美元,按里程碑分批归属至 2030 年。Meta 的协议结构完全相同,两家合计 3.2 亿份认股权证,约占 AMD 总股本的 20%。

但所有这些光环之下,SemiAnalysis 挖出了两个致命问题。

105% 折扣背后的金融工程

SemiAnalysis 在文章中披露了一个令人震惊的细节:AMD 正在通过金融工程给 OpenAI 和 Meta 提供接近 105% 的股权返点折扣。

这个数字意味着什么?当 OpenAI 和 Meta 购买足够多的 AMD 算力,且 AMD 股价达到 600 美元目标价时,AMD 通过股票期权和财务工程手段,实质上返还了客户支付的几乎全部硬件成本,甚至倒贴了 5%。Helios 的每 Token 总拥有成本(TCO)实在太低,以至于在返点之后,OpenAI 的每百万 Token 成本变成了负数。

这不是传统的“量大从优”折扣。这是 AMD 用自己未来的股价上涨,来补贴客户今天的采购决策。背后的逻辑是:如果 AMD 能通过这种激进的定价策略,让 OpenAI 和 Meta 大规模部署自己的芯片,就能在 AI 加速器市场站稳脚跟,进而推动股价上涨,最终用股价上涨的收益来覆盖今天的补贴。

这是一个典型的“卖铲子送铲子”战略。但风险同样明显:如果 AMD 的股价不涨,或者客户采购量不及预期,那么 AMD 就相当于真金白银地烧掉了自己的利润。合计 3.2 亿份认股权证一旦全部行权,将稀释现有股东约 20% 的权益。

SemiAnalysis 指出,Helios 的每 Token TCO 本身确实极低,这是 AMD 敢于给出如此激进折扣的前提。但即便如此,105% 的返点折扣在半导体行业历史上也极为罕见,几乎等同于 AMD 在说:“只要你们用我们的芯片,我们免费送机柜,还倒贴 5%。”

Helios 生产爬坡的地狱模式

对 AMD 更直接的挑战在供应链端。SemiAnalysis 的供应链调研和工程原理分析显示,AMD 的首个整机架系统 Helios 正面临缓慢的机架生产爬坡。

Helios 机架没有采用无电缆设计。相比之下,NVIDIA Rubin Oberon 机架已经实现了无电缆化,大幅简化了生产和部署流程。Helios 每个机架需要大量电缆,增加了装配复杂度和故障点。

AMD 的 SerDes 设计较弱,这意味着高达 85% 的背板需要信号重定时。每台 Helios 机架需要超过 550 颗 Broadcom 以太网重定时器。这不仅增加了物料成本,更增加了信号完整性和可靠性风险——在 224G PAM4 信令下,背板损耗预算已经极其紧张,每颗重定时器还会额外增加数瓦功耗和数十纳秒延迟。

机架背板在生产爬坡过程中遇到了可靠性问题。SemiAnalysis 将这些挑战形容为“生产爬坡地狱”——这个词在半导体行业通常意味着良率失守、交付延迟和客户不满。

这些生产问题对 AMD 的影响是双重的。一方面,它限制了 Helios 的交付量,可能让那些已经签下大单的客户等待更久。另一方面,更重要的是,它影响到了 AMD 内部的软件开发进度。

内部开发集群不稳定——软件进步的最大敌人

SemiAnalysis 通过大量内部工程反馈发现,AMD 内部软件工程师最大的抱怨是:缺乏稳定的 GPU 集群用于软件开发和自动化测试 CI。

这是一个经典的“鸡生蛋”问题。AMD 需要更好的软件来吸引客户购买 GPU,但生产出来的 GPU 要么被发给了客户,要么在生产爬坡中出了问题,导致内部开发团队没有足够的稳定集群来改进软件。更讽刺的是,AMD 正在大力推广 AI 编程 Agent 来加速软件开发——但这些 AI Agent 本身也需要 GPU 来运行,每个 Agent 的推理和工具使用循环都要消耗算力。

这意味着,AMD 在软件层面的很多潜在改进,因为硬件集群不足,无法充分发挥 AI Agent 的效能。SemiAnalysis 指出,这是 AMD 当前面临的最大内部风险之一。

但好消息是,AMD 确实在改进软件,而且进展可观。

Agentic 时代的软件翻身仗

SemiAnalysis 的态度转变,核心在于 AMD 软件栈的切实改善。

AMD 的 ROCm 编译器和大部分内核已经开源。在 AI Agent 时代,这意味着 AI 编程工具可以自动学习和优化 AMD 的软件栈。Anthropic 的算力负责人 Tom Brown 透露了一个细节:他周末用 Claude 配合一个 "/goal" 指令,就完成了在 AMD 硬件上部署 Claude 推理栈的工作。

更关键的是,AI 编程 Agent 已经能够自动将 CUDA 内核移植到 ROCm 平台。SemiAnalysis 在文章中详细描述了这一趋势:随着 AI Agent 的编码能力飞速提升,原来需要 AMD 工程师数月才能完成的内核移植工作,现在 AI 可以自动完成。CUDA 的护城河正在被 AI 自己填平。

AMD 的软件质量也在快速提升。SemiAnalysis 指出,AMD 有一批真正的 10 倍效率工程师正在以 997 的节奏工作——这些人大部分在 AMD 上海团队。MoRI 集合通信库、UMBP KVCache 卸载、以及去中心化推理应用的前沿部署工程团队,都集中在上海。这些团队真正理解如何基于第一性原理做推理工程的优化。

ROCm 7.2 在 ComfyUI 等消费级 AI 场景上实现了最高 5 倍的性能提升。虽然 CUDA 在通用计算方面仍领先 10% 到 30%,但在内存密集型任务上,AMD 凭借更大的 HBM 容量已经实现了反超。PyTorch 已将 ROCm 列为与 CUDA 平级的“一等公民”。

AMD 还利用了去中心化推理(PD disagg)技术,联合 Cerebras 实现超快速交互推理,在推理场景中进一步缩小了与 NVIDIA 的差距。

结论与展望

SemiAnalysis 的最终判断值得认真对待。他们认为,AMD 在 CUDA 护城河上的突破已经从一个“零概率事件”变成了一个“需要认真对待的可能性”。但有两个前提必须满足:第一,解决 Helios 的生产爬坡问题;第二,为内部开发团队提供足够的稳定 GPU 集群。

即便 AMD 成功了,这也并不意味着 NVIDIA 会失败。AI 加速器市场本身正在以前所未有的速度膨胀,NVIDIA 的营收将继续大幅增长。AMD 的竞争更多是在软件层面,迫使 NVIDIA 和黄仁勋必须砍掉 bureaucracy,减少内部审批层级,才能保持领先优势。

AMD 通过金融工程给出的 105% 折扣,本质上是在买时间。它在用股价上涨的预期换取客户生态的快速建立。这笔赌注能否成功,取决于 Helios 能否顺利交付,以及 ROCm 能否在 AI Agent 的帮助下尽快追上 CUDA。

如果这两个条件都满足了,AI 基础设施市场将迎来真正的双寡头时代。而这对整个行业来说,或许才是最好的结果。

CUDA 的护城河从未被填平,但 AI 正在自己动手拆掉它。

作品声明:内容由AI生成