DLSS 5被开源复刻 RTX 4070跑4K仅29毫秒
英伟达DLSS 5的技术壁垒,最近被一位叫MAAN的开发者给撬开了。他放出了名为OpenDLSS-NR的项目,说白了就是DLSS 5神经渲染网络的开源Vulkan重写版。这事儿最炸裂的地方在于,DLSS 5头一回能在非RTX 50系的显卡上跑起来。
这项目可不是随便糊弄一下。MAAN精准复现了DLSS 5运行时DLL版本310.8.0里的71块神经网络结构。他自己说,输出结果跟英伟达官方的实现能做到“比特级一致”。不光是最后看到的画面,就连全部75个中间块边界的输出数据,都是逐字节对上的。

从技术底子来看,这套网络用的是U-Net架构,里面还融合了移位窗口Transformer和全局视觉Transformer。计算上采用FP8激活值加FP16累加精度,整个模型权重大概141MiB。这套组合拳打下来,理论性能相当可观。
实测数据也出来了。MAAN拿RTX 4070 SUPER跑的测试显示,768×768分辨率下执行只要2.8毫秒,1080p是7.8毫秒,1440p要12.6毫秒,到了4K则是29.3毫秒。这说明DLSS 5的完整网络,在Ada Lovelace架构上已经能高效运转了。

更让人意外的是还有个WebGPU移植版。这个版本完全不靠英伟达的Tensor Core,也不用原生FP8支持,直接在浏览器里就能跑。512×512分辨率下耗时72毫秒,比原生实现的2.7毫秒慢不少,但这足以证明DLSS 5的神经网络能被拆解开,放到非英伟达硬件上运行。
不过现在这项目还有不少限制。代码库里没带英伟达的专有模型权重,用户得自己去找来提供。而且它不是那种装上就能玩游戏的模组,是个独立实现,配了个基于Google Filament引擎的演示渲染器,支持运动矢量和时序反馈,但还没做DLSS超分辨率那块功能。
对于手里只有RTX 40系显卡的玩家来说,这玩意儿至少点亮了一种可能性。虽说离真正进游戏实战还差着一截,但它实打实地证明了,DLSS 5的核心技术压根不是非得绑死在最新硬件上才能活。