DLSS 5 跑上了 AMD 显卡,帧率却只剩个位数

2026.09.05 16:21
MOD 开发者 Daniel Blanco 发布 DLSS-NR for AMD 工具,首次在 AMD Radeon RX 9070 XT 上成功运行英伟达 DLSS 5 神经渲染技术。但在《赛博朋克 2077》1080P 分辨率下,帧率从 80 FPS 暴跌至约 30 FPS。'能跑'的表象背后,是硬件兼容与软件生态之间的真实鸿沟,也是英伟达技术护城河的一次压力测试。

一个被官方锁死在 RTX 50 系列上的技术,在 AMD 显卡上被“偷”出来了。但结果更像是行为艺术,而非实用突破。

2026 年 9 月 4 日,开发者 Daniel Blanco(GitHub 账号 danielblnc)发布 DLSS-NR for AMD 工具,让 AMD RDNA 4 架构的 Radeon RX 9070 XT 首次跑通了英伟达的 DLSS 5 神经渲染。在 YouTube 频道 Ancient Gameplays 的测试中,《赛博朋克 2077》1080P 分辨率下,开启 DLSS-NR 后帧率从原生 80 多 FPS 骤降至 11~12 FPS。开发者随后推出 Alpha v0.2.7 更新,性能回升约 12%,最终约 30 FPS。

能跑,但跑得像幻灯片。而这个“技术越狱”背后,藏着关于硬件兼容、商业壁垒与生态差距的复杂博弈。

DLSS 5 的“高墙”与一个民间破壁者

DLSS 5 是英伟达 2026 年 3 月在 GTC 大会上公布的下一代 AI 图形技术,9 月 3 日随《NBA 2K27》首发上线。与以往的 DLSS 版本不同,DLSS 5 的核心是引入实时神经渲染——一个拥有约 1.48 亿参数的扩散 Transformer 模型,在像素空间用生成式 AI 为游戏补充光照、材质和皮肤细节,目标是接近好莱坞级别的照片级真实感。该模型以 FP8 精度运行。

英伟达官方明确表示,DLSS 5 仅限 RTX 50 系列(Blackwell 架构),依赖第五代 Tensor Core 的 FP8 加速能力。即使是对 RTX 40 系列的支持,也是在社区强烈反弹后才于近期松口。

但 MOD 社区显然不打算等官方开恩。

Blanco 的工具 DLSS-NR for AMD 操作出奇简单:用户将安装程序和英伟达的 nvngx_dlssnr.dll 文件放入游戏的 bin 文件夹,通过 FSR 3 或 FSR 4 配置文件切换神经渲染,即能在 AMD 显卡上调用英伟达的模型。已测试游戏为《赛博朋克 2077》和《GTA V:增强版》。

之所以能跑通,技术原因很直接:DLSS 5 使用的 FP8 运算格式,恰好是 AMD RDNA 4 架构原生支持的——和 RTX 40/50 系列一样。不需要指令转换,不需要 CUDA 仿真,纯硬件层面兼容。

“纯硬件层面兼容”,这句话既是希望,也是陷阱。

FP8 兼容不等于性能可用

RDNA 4 能够原生支持 FP8 E4M3 格式矩阵运算,这不仅去掉了旧架构上 FP8 到 FP16 指令转换的巨大开销,也省去了后者带来的寄存器压力和流水线停顿。数据显示,旧架构上的指令转换会导致 11.9 条静态指令对比 2.6 条的执行差距。

但 DLSS 5 的神经渲染模型远不止是一组 FP8 矩阵乘法。

该模型是一个 1.48 亿参数的扩散 Transformer,包含 Swin 和 ViT 架构块、QKV 投影和专用的 FP8 核心。在单帧处理上,它占用了约 60 FPS 游戏每帧可用时间的全部。英伟达为此在 Blackwell 上优化了整套推理管线——从第五代 Tensor Core 的硬件调度,到 TensorRT 编译器和 NGX 框架的驱动层支持。

AMD 的 RDNA 4 虽然硬件达标,但缺少这套软件栈。这不是指令集对齐可以解决的问题。

数据佐证了这一点。MOD 社区此前已尝试在英伟达自家旧架构上非官方运行 DLSS 5。结果对比相当说明问题:RTX 4090(Ada Lovelace,同样原生支持 FP8)跑 DLSS 5 时性能下降 36~39%。RTX 3080(Ampere,需 FP8 到 FP16 转换)暴跌约 97%。连英伟达上一代旗舰都扛不住的负载,AMD 的首次尝试——帧率从 80 多掉到 30——并不算意外。

但问题不止于此。30 FPS 是 1080P 下的结果。考虑到 DLSS 5 以 4K 为设计目标,画面分辨率每提升一档,神经渲染的计算量还会进一步加重。

能跑英伟达的技术,恰恰暴露了 AMD 的软肋

这个 MOD 最讽刺的地方在于:AMD 用户需要靠“偷”对手的技术,来弥补自家生态的短板。

AMD 的对应方案 FSR 4 已随 RX 9000 系列上市。FSR 4 从纯算法方案转向了 AI 驱动,画质相比前代有了明显提升。但问题在于:FSR 4 锁死在 RDNA 4 架构上,不支持上一代 RDNA 3 显卡。而 DLSS 的基本超分辨率功能至少覆盖了 RTX 20 系列以来的所有英伟达显卡。

在技术质量上,第三方评测也显示 FSR 4 在图像稳定性方面仍落后于 DLSS。一个闭源技术加上需要“越狱”才能用的对手方案,反而在很多玩家眼中是更优的选择——这对 AMD 来说极为尴尬。

AMD 面临的不是硬件能力瓶颈,而是软件生态建设的系统性差距。这种差距不是靠一代架构就能跨越的。

概念验证,远非实用工具

需要明确的是,DLSS-NR for AMD 当前远远达不到日常可用标准。它的局限性极为明显:仅支持 RDNA 4(RX 9000 系列),旧卡完全不支持;反作弊系统会阻止 DLL 加载,因此使用范围仅限没有反作弊限制的单人游戏;无法调整 DLSSNR 的渲染预设和强度滑块,处于“全开不可控”状态。

本质上,这是一个概念验证原型。MOD 作者本人也未将其定位为成熟产品。

但概念验证的价值不在于好不好用,而在于它揭露了什么。

它揭露了英伟达“仅限 Blackwell”的说法中,商业动机大于技术必要性。RDNA 4 的 FP8 原生支持证明了只要有硬件基础,闭源软件栈并非不可逾越。同时也暴露了 AMD 在 FSR 生态上的困境——当你的用户不得不借对手的技术来跑“AI 画质”时,你很难说自己处于领先位置。

真正的护城河不在硬件,在软件栈

DLSS-NR for AMD 这个 MOD 的意义不在于让 AMD 用户现在就能用上 DLSS 5——远远不能。它的意义在于提供了三个清晰的信号。

第一,英伟达的硬件壁垒在 MOD 社区面前是透风的。DLSS 5 泄漏后一周内就扩散到了 AMD 平台,其传播速度和广度远超英伟达预期。

第二,真正的护城河不在指令集兼容性,而在 NGX 框架、CUDA 生态、驱动级推理优化和一贯的软件投入。英伟达花了十几年打造的这套系统,不是 AMD 一代架构能撼动的。

第三,AMD 需要的不是一个“也能跑 DLSS 5”的 MOD,而是自己的一套从硬件到软件栈的完整 AI 图形方案。FSR 4 是起点,但远远不够。

这场“技术越狱”的结果暂时被定格在 30 FPS。它能继续优化,还是到此为止,取决于社区的投入程度和英伟达后续是否会修补兼容路径。但无论去向何方,它已经证明了:在 AI 时代,软件栈的厚度比硬件规格的高低更能决定最终体验。

DLSS 5 在 AMD 上能跑。但跑出来的,不是“5”,是“30”。

作品声明:内容由AI生成