NVFP4加持仅换来1%性能,DLSS 5的优化之路有多难?

2026.09.12 10:59
2026年9月,Mod开发者wilsjo2在RTX 50系列上测试DLSS 5的NVFP4混合精度方案,实测帧率仅提升约1%。技术分析揭示:DLSS 5的模型架构尚未完成对NVFP4的原生量化适配,模型形状兼容性限制导致部分计算回退至FP8。英伟达虽已确认DLSS 5将在今年晚秋扩展至RTX 40系列,但NVFP4的1%增益指向一个更深的行业困境——硬件先走了一步,软件还没跟上。

NVFP4,这个被英伟达视为Blackwell架构最重要创新之一的4位浮点格式,理论吞吐是上一代FP8的整整2倍,在DLSS 5这个当下最强的神经渲染场景上,只换来了不到1%的帧率提升。

《博德之门3》4K分辨率下,纯FP8方案的DLSS 5跑出54.57 FPS,换成FP8/NVFP4混合精度方案后,帧率攀升至55.16 FPS,0.59帧的增幅,约1.08%。Mod开发者wilsjo2借助OptiScaler-DLSSNR项目的0.7.1版本,成功将DLSS 5的神经渲染模型部分迁移至NVFP4格式运行。但实测结果让所有人冷静了下来:神经渲染阶段耗时仅减少1%–2%,而且部分计算因模型形状兼容性问题仍然回退至FP8。开发者在Release Notes中将自己的改进描述为“VERY minor”。即使到了0.7.2版本将混合模式设为推荐选项,他也明确警示:0.59帧的差异“是否可重复尚未确认”。

NVFP4的潜力被严重低估了吗?不。真正的问题或许恰恰反过来——DLSS 5当前的模型架构,根本吃不下NVFP4的红利。

一枚神卡,一项瓶颈技术

2026年9月,DLSS 5正式随NBA 2K27首发。同一周内,两个标志性的测试结果同时在硬件圈引爆了讨论。

一边,独立评测机构Club386在2026年9月3日发布的RTX 5090基准测试揭示了残酷的现实。在《赛博朋克2077》《霍格沃兹之遗》《Control》三个游戏中,开启DLSS 5后帧率暴跌39%至49%。RTX 5090 Founders Edition在《赛博朋克2077》从482W飙升至551W,《霍格沃兹之遗》从417W升至547W,《Control》更是直接顶到575W的板卡功率上限。DLSS 5不再是“免费性能提升”,它成了有史以来计算开销最昂贵的DLSS版本。

另一边,Mod作者wilsjo2在OptiScaler-DLSSNR项目0.7.1版本中,把DLSS 5的神经渲染模型从纯FP8推进到FP8/NVFP4混合精度。Blackwell的第5代Tensor Core原生支持NVFP4格式。英伟达官方数据显示,NVFP4采用微块缩放,每16个4位元素共享一个缩放因子,相比MXFP4的32元素块大小,更细的粒度意味着更少的量化误差。NVFP4的峰值吞吐达到FP8的2倍,内存占用更低。理论上,这简直是给DLSS 5这样高开销的推理任务量身定做的优化路径。

但实测结果让人沉默:55.16 FPS vs 54.57 FPS。

DLSS 5无疑是DLSS史上开销最大的版本。而NVFP4这个Blackwell架构最引以为傲的原生能力,在DLSS 5面前,似乎有力使不出。

三问“NVFP4为什么没能拯救DLSS 5”

第一问:模型精度量化,难道不是换个格式就能跑?

NVFP4的纸面优势没有水分。英伟达官方技术博客明确写道,NVFP4在Blackwell上原生运行,为每个16元素的微块分配独立的缩放因子,量化精度优于MXFP4。在LLM推理和AI训练场景中,NVFP4的4位预训练能力已经被多方验证。MIT Han Lab的研究甚至证明,SVDQuant结合NVFP4能在FLUX.1-dev模型上达到接近16位精度的输出质量。

但“能跑”和“跑得好”是两回事。

一个神经网络从FP8迁移到NVFP4,远不止是改一行数据类型代码。它需要重新进行量化感知训练,需要重新校准模型各层的敏感度分布,需要为低精度路径重新设计推理内核。直接把FP8训练好的模型权重暴力截断到4位,这就是当前Mod的做法,精度损失会迅速累积,模型输出质量退化到不可接受的程度。

英伟达此前已向媒体确认:DLSS 5的官方版本“尚未完成”向NVFP4的全量量化。连英伟达自己的工程团队都还没有把这件事搞定。一个社区Mod能在短短几天内跑通混合精度路径,已经算得上技术成就。但因为缺乏原生的QAT支撑,它只能在模型层面做“表层替换”,无法触及NVFP4的深层优势。Wccftech在报道中引用了英伟达的官方说法:“高效地将一个神经网络迁移到如此低精度的格式,需要适当的量化和优化,而不仅仅是简单转换现有模型。”

直白一点讲,硬转没有用,需要从头训。

第二问:模型形状兼容性,DLSS 5的“隐形天花板”

即便成功启动了混合精度推理,Mod也无法让所有计算都跑在NVFP4上。问题的名字叫:模型形状兼容性。

DLSS 5的神经渲染模型包含多个子网络,不同子层的张量形状各异。NVFP4的Tensor Core实现并非对所有形状都做了等量齐观的优化,某些形状组合在NVFP4路径上没有对应的内核实现,只能fallback回FP8。这就造成了一个尴尬的局面:理论上调配了NVFP4,实际运行中相当一部分计算仍然跑在FP8上。

这指向了一个更普遍的行业困境,低精度AI推理的碎片化生态。FP8本身就有E4M3和E5M2两种格式,各有优缺点。NVFP4在FP8之上又加了一层新格式。每一种格式都有自己最优的张量形状区间、内核调度策略和硬件支持范围。模型越大、结构越复杂,“全格式覆盖”的难度呈指数级上升。

DLSS 5的神经渲染模型恰恰是英伟达有史以来最复杂的实时推理模型之一,它要处理场景几何、光照、材质、反射等多个维度的信息。这种复杂度天然与NVFP4当前的覆盖能力存在冲突。从0.7.1到0.7.2版本的快速迭代也说明了这一点:wilsjo2在两天内就把NVFP4混合模型从“可选模式”升级为Blackwell GPU的“推荐模式”。技术优化的空间肯定存在,但天花板也清晰可见——模型形状的天花板,不是换个内核就能突破的。

第三问:DLSS 5的“性能债务”,英伟达到底多紧迫?

DLSS 5性能开销大,这已经不是一个秘密。

英伟达自己在官方博客中承认,从GTC 2026上演示的双RTX 5090配置一路优化到单个RTX 50系列可运行,团队在6个月内实现了5倍的性能提升,从“双卡才能跑”到“单卡流畅跑”,这个速度本身就是英伟达对“DLSS 5太贵了”的潜在回应。

但5倍性能提升之后,DLSS 5仍然能吃掉RTX 5090近一半的帧率。XenoSpectrum的另一组独立测试也得出了相似的结论:Control在RTX 5090 FE上从87.5 FPS降至50.9 FPS(-42%),性能保留率仅约58%;霍格沃兹之遗从121.1 FPS降至62.8 FPS(-48%),性能保留率仅约52%。这意味着“收益递减曲线”已经非常陡峭。前期的架构优化——算子融合、Pipeline重组、内存访问优化——能快速带来倍数级提升,但越往后,每一步的边际收益越小。NVFP4的1%增益,就是这种边际收益递减的直接体现。

对英伟达而言,DLSS 5不仅是技术产品,更是一项商业武器。它是RTX 50系列“非买不可”的核心卖点之一,如果DLSS 5始终处于“开了降一半帧率”的状态,英伟达就很难说服消费者为Blackwell支付溢价。这也是为什么英伟达在2026年9月4日紧急反转口径,向The Verge和Wccftech确认DLSS 5将支持RTX 40系列。他们需要基数更大的用户群来分摊优化成本,也需要安抚那些手握RTX 4090、本打算跳过50系列的存量用户。

但这里有一个被很多人忽略的竞争维度:如果NVFP4在DLSS 5上只换来1%的增益,那NVFP4在其他端侧推理场景中的价值是否需要重估?AMD的FSR和英特尔的XeSS都在追赶。如果英伟达最强的架构特性在其最重要的应用场景上“失灵”了,竞争对手的追赶窗口可能会意外地变宽。

当然,这个判断必须加一个重要的限定条件:当前Mod只是粗粒度的表层转换。一个经过充分QAT训练的原生NVFP4模型表现会完全不同。但“原生训练”意味着时间和算力成本,在大模型Scaling Law竞争白热化的2026年,英伟达的算力资源同样稀缺。

三个信号,一个判断

第一个信号:DLSS 5的优化已进入边际收益递减区间。从“双卡才能跑”到“单卡流畅跑”用了6个月和5倍提升,但从5倍再往前推,每一步都会越来越难。

第二个信号:NVFP4的潜力释放需要模型原生支持,而不是“后装改造”。这不仅是DLSS 5的问题,也是整个AI推理行业从FP8向更低精度迁移时都会遇到的共性难题——硬件先走了一步,软件还没跟上。

第三个信号:英伟达选择了“先上市、后优化”的路线。DLSS 5在GTC 2026到9月首发之间完成了惊人的5倍优化,但消费者拿到手时,它仍然是一个“半成品”——NVFP4的兼容性、RTX 40系列的正式支持、模型形状覆盖的扩展,全都排在了后续路线图上。

对于RTX 50系列的用户,短期建议可能略显尴尬:在大多数游戏中,DLSS 5的神经渲染目前仍然是一个“画质优先于帧率”的开关。开启它之前,值得先问问自己——你是想要更好的光照反射,还是想要更流畅的战斗体验?

NVFP4绝不是一个失败的技术。它在LLM推理和AI训练场景中的表现已经证明了4位精度的巨大潜力。只是在实时图形渲染这个极端苛刻的场景下——延迟单位是毫秒、帧率波动能被肉眼察觉、575W的功耗墙就在那里——“理论优势”到“实际增益”之间的鸿沟,比大多数人想象的要宽得多。

硬件给了你更快的轮子,但路还没铺好。

作品声明:内容由AI生成

快报

更多

10:57

国家数据局局长刘烈宏主持召开具身智能座谈会

10:29

内蒙古阿拉善盟阿拉善左旗发生3.6级地震,震源深度8千米

09:53

中国电信总经理刘桂清:深化算电协同,加强算力与电力产业在规划、建设、运营方面深度融合

09:24

伊朗和阿曼将通报霍尔木兹海峡通航磋商结果

09:23

乌官员:乌克兰准备10月举行新一轮乌美俄三方谈判

09:22

埃里森取消出售至多5000万股甲骨文股票的计划

09:20

加拿大总理将出访欧洲,加强伙伴关系

09:19

英国海上贸易行动办公室:一艘船只在霍尔木兹海峡遇袭

09:17

著名主持人敬一丹去世,享年71岁

09:10

预告:国新办定于9月14日举行国务院政策例行吹风会,介绍加强中小企业回款难问题治理有关工作情况

09:08

国家医保局公布医疗机构涉医药购销商业贿赂案

2026-09-12 23:00

习近平会见印度总理莫迪

2026-09-12 22:43

Anthropic联合创始人兼首席执行官:必须放慢提升AI模型能力的速度

2026-09-12 22:16

中国聚变:正全力推进全球首个高温超导强场稳态燃烧实验平台研发

2026-09-12 21:48

巴勒斯坦总统:期待巴中战略伙伴关系不断取得新发展

2026-09-12 21:47

恺英网络:拟间接参股韩国公司Wemade,整体预估出资2.98亿美元

2026-09-12 21:46

iPhone 18 Pro系列多电商平台售罄

2026-09-12 21:17

苹果iPhone 18 Pro/Pro Max开启预购

2026-09-12 20:44

与谷歌合作智能家居项目是否涵盖AI眼镜相关产品?创维数字回应

2026-09-12 20:41

“铁建起重5000”大型起重船离港赴远洋施工