AMD 掷出 ROCm 10:AI 推理战场上的软件翻身仗

2026.08.28 18:28
AMD 发布 ROCm 10.0.0,版本号从 7.14 直接跃升至 10.0,标志着十年来最大规模的软件平台升级。新版本以 ROCm.AI 为核心——包含 Hyperloom 自主优化智能体、AMD Skills 和 ROCm CLI——AMD 正在用 AI 自身的自动化能力来弥补软件生态短板,在 AI 推理快速成为算力主战场的行业拐点上,打响了一场差异化的软件翻身仗。

“AMD 软件不行”——这句话在过去五年里,几乎是 AI 圈不需要讨论的共识。每一次 AMD 发布新的 Instinct GPU,评测文章都会在最后附上一句“软件生态仍需追赶”。但 2026 年 8 月 28 日发布的 ROCm 10.0.0,可能正在改写这个剧本。

这不是一次常规的版本迭代。版本号从 7.14 直接跳到 10.0,本身就是信号。AMD 用十年的跨度,为这个开源 GPU 计算平台打上了“十周年”的标记。但真正值得关注的不是版本号的跳跃,而是这次发布的核心逻辑已经变了——AMD 不再只是追着 CUDA 补课,而是开始用 AI 自身的逻辑来攻 AI 的软件城墙。

版本号背后的三重信号

AMD 在本周正式发布了 ROCm 10.0.0。这个版本号不是按数字序列自然推进的,而是一次有意的“大版本跃进”——从 7.14 跳到 10.0,跨越了 8.x 和 9.x 两个世代。官方博客的解释是:十周年纪念,以及“版本号是实至名归的”。

但更实质的变化藏在版本号背后。这是第一个完全基于 TheRock 自动化构建系统产出的生产版本。TheRock 在 ROCm 7.14 中达到生产就绪状态,到 10.0 时,整个平台的构建、验证和发布已经全部跑在同一条流水线上。这意味着什么?AMD Instinct 数据中心加速卡、Radeon 消费级显卡、Ryzen AI 集成显卡——这三种形态迥异的硬件,首次共享同一套软件栈,同一个发布节奏。你在笔记本上用 Ryzen AI 跑的原型代码,可以直接部署到数据中心 Instinct 集群上。

这是 AMD 对英伟达“统一计算架构”策略的回应。CUDA 之所以不可撼动,不是因为它的 API 设计得比 HIP 好,而是因为“写一次,跑在任何英伟达 GPU 上”这个承诺十年如一日地兑现。ROCm 10.0 试图复制同样的故事。

AI 框架的升级也同步到位:PyTorch 2.12.0、JAX 0.10.0、vLLM 0.23.0、SGLang 0.5.13、TensorFlow 2.21,以及 MIGraphX 和 ONNX Runtime。vLLM 0.23.0 和 SGLang 0.5.13 是目前 AI 推理场景中最主流的两大服务框架,升级到最新版本意味着 AMD 的推理部署方案可以与英伟达站在同一起跑线上。

GPU 支持列表也扩展了,新增了 8GB 和 4GB 显存版本的 Radeon RX 9050 系列,以及多款 Ryzen AI Max/Max PRO 系列 APU。虚拟化支持同时得到增强。ROCm 的覆盖范围正在从“数据中心专用”向“无处不在”转变——从云端 Instinct 到桌面 Radeon,再到笔记本上的 Ryzen AI。

ROCm.AI:用 AI 解决 AI 的软件问题

这次发布最值得关注的新事物是 ROCm.AI。它在 2026 年的 Advancing AI 大会上首次亮相,现在随 ROCm 10.0 正式面向所有用户开放。

ROCm.AI 由三部分组成。

第一部分是 AMD Skills,一套经过 AMD 验证的工作流,嵌入到 Claude Code、Cursor、Codex 等 AI 编程助手中,让开发者直接在熟悉的工具里获得 AMD 硬件优化建议——从诊断、路由、回放分析到性能优化,覆盖客户端到服务器端的全栈场景。

第二部分是 ROCm CLI,一个统一的命令行界面,用于管理 ROCm 环境、部署模型、运行诊断。它目前处于技术预览阶段,但已经支持 Windows 和 Linux 双平台,并且不需要预先安装 ROCm。开发者可以用它来检查系统状态、安装和管理多版本 ROCm 运行时、部署模型服务,还可以通过内置的 ROCm Console 实时监控 GPU 利用率、功耗和 tokens per watt 等指标。

第三部分是 Hyperloom,一个自主智能体系统。它自动分析推理工作负载,识别瓶颈,探索优化选项,实施调整,然后验证效果——整个过程几乎不需要人工干预。Hyperloom 支持 vLLM 和 SGLang,可以针对 HIP、Triton 和 FlyDSL 三种编程模型进行优化,最终输出一份包含代码变更和性能对比的报告。

AMD 官方数据称,在相同硬件上,使用 ROCm.AI 的配置相比 ROCm 7 平均提升 3.3 倍推理性能、2.4 倍训练性能。这个数字需要审慎看待——它是在特定优化场景下取得的,不代表所有工作负载都能获得同等幅度的提升。但方向本身比具体数字更重要:AMD 正在用 AI 的自动化能力来弥补自身在软件生态上的“人力差距”。

推理是第一战场

如果说 ROCm 10.0 有一个明确的战略重心,那就是 AI 推理。

这不是巧合。根据 Deloitte 的报告,推理工作负载在 2025 年占 AI 总计算量的约一半,2026 年将增长到三分之二。IDC 和 Gartner 的分析也指向同一个方向:AI 基础设施投资正在从训练向推理转移。推理的算力消耗虽然单次低于训练,但它的调用量是训练的数百万倍——每一个用户、每一次对话、每一轮推理,都在消耗算力。

在这个战场上,英伟达的护城河比训练市场更浅。推理对定制 CUDA 内核的依赖度较低,对框架集成如 vLLM、SGLang 的依赖度更高。只要 ROCm 能把这些框架跑顺畅,用户迁移的成本就会大幅降低。ROCm 10.0 正是沿着这个方向推进的。

AMD 在推理硬件上的性价比优势也在放大这个窗口。MI300X 配备 192GB HBM3 显存,在大模型推理的长上下文场景中天然占优。行业分析显示,AMD 的 GPU 在推理场景中通常有 15% 到 30% 的价格优势,而 ROCm 10.0 的推理性能已经能接近 H100 的 90% 到 95%。当性价比差距缩小到这种程度,软件上的“最后一公里”就成了决定性的因素。

从追赶 CUDA 到另辟蹊径

纵观 ROCm 过去十年的演进,一条清晰的曲线浮现出来。

2016 年到 2022 年的 ROCm 1 到 5 是“生存期”,核心任务是让 HIP 兼容 CUDA 语法,让 PyTorch 跑在 AMD GPU 上。2023 年到 2025 年的 ROCm 6 到 7 是“追赶期”,重点是性能优化、框架支持和稳定性提升。而 2026 年的 ROCm 10 则进入了一个新阶段——可以称之为“差异化期”。

ROCm.AI 就是这种差异化策略的集中体现。英伟达的 CUDA 生态强在“人力”——数千名工程师持续优化 cuDNN、TensorRT-LLM 等库,加上庞大的开发者社区贡献自定义内核。AMD 没有同等规模的人力,但它选择用 AI 来弥补:让 Hyperloom 自动完成那些在其他平台上需要人工完成的优化工作。

这种策略的成败,取决于 Hyperloom 等自动化工具的成熟度,而不是 AMD 能否雇到和英伟达一样多的工程师。如果这条路走通了,它不仅解决了 AMD 的软件短板,还可能重新定义 GPU 编程的范式——从“手写优化”转向“AI 辅助自动优化”。

AMD 还在做另一件重要的事:整合软件分发渠道。新的 repo.amd.com 将 ROCm 包、amdgpu 驱动和 AMD 的 GPU 工具全部整合到一个仓库中,统一命名、统一结构、统一指令。多版本 ROCm 可以在一台机器上共存,团队可以按自己的节奏分阶段升级,而不是被迫跟随发布列车的时间表。对于自动化部署的团队来说,这意味着 CI/CD 管道只需要指向一个仓库地址。

进步与局限

ROCm 10.0 的进步是真实的,但它的局限同样真实。

AMD Skills 目前仅支持 Claude Code、Cursor 和 Codex 三个 AI 编程助手。这意味着它的用户群被限制在已经使用这些工具的开发者范围内。对于使用 VS Code 原生开发流程或 JetBrains 等 IDE 的开发者,AMD Skills 还不适用。

ROCm CLI 目前仍处于技术预览阶段,官方文档明确标注了“正式支持即将到来”。生产环境部署的团队可能还需要等待一个更稳定的版本。

一些关键性能库仍然缺失。FlashAttention 3 和 TensorRT-LLM 的完整 ROCm 等价物尚未就绪,这意味着在依赖这些库的高端推理场景中,ROCm 的性能差距仍然存在。社区生态的规模差距也是现实——CUDA 的开发者社区经过 15 年积累,已经形成了庞大的知识库和第三方工具生态,ROCm 的社区虽然在快速增长,但规模仍然远小于 CUDA。

写在 AI 推理的拐点上

ROCm 10.0 的发布,是 AMD 在 AI 软件战场上的一个关键转折点。它不再是“我也能做到 CUDA 做的事”,而是“我用一种不同的方式来做 GPU 计算”。

这个策略的核心假设是:AI 推理市场足够大,容得下第二个计算平台。英伟达在推理市场的份额虽然领先,但不像训练市场那样具有压倒性——因为推理更看重性价比和生态开放性,而这两点恰好是 AMD 的差异化优势。

对开发者来说,ROCm 10.0 传递了一个明确的信号:AMD 的软件平台正在快速成熟,如果你在搭建 AI 推理基础设施,现在值得认真评估 AMD 的选项。尤其是对预算敏感的中型团队和创业公司,AMD 的性价比优势加上 ROCm 10.0 的软件提升,可能已经足够抵消迁移成本。

AMD 花了十年才让 ROCm 追上 CUDA 的背影,但 ROCm 10.0 选择了一条更聪明的路——在 AI 的赛道上,与其跟在别人后面跑,不如让 AI 自己开车。

作品声明:内容由AI生成