DLSS 5被移植Intel核显!全靠AI写代码:140V跑出10.5帧
DLSS 5这回真被塞进了Intel的核显里。开发者Uzbekunknown搞了个项目叫dlss-nr-on-intel,硬是把NVIDIA那套神经网络渲染给移植到了锐炫140V上。虽然跑得慢吞吞,但好歹能出画面,这事儿本身就够稀奇。

说白了,这项目的玩法跟以往大不一样。代码基本全是AI写的,Anthropic的Claude和OpenAI的GPT-6 Astra干了大头活儿。Uzbekunknown自己就管三件事:提供硬件、扔二进制文件、定方向。
剩下的,全交给AI agent去折腾。 更逗的是,开发中途AI还闹了个乌龙。它幻觉出一个压根不存在的驱动Bug,这误会直接把三个开发阶段带偏了路。不过作者挺实在,没把这弯路删掉,照样记在了项目笔记里。

跟之前那些简单的DLSS hack不一样,这次是真刀真枪地重写。DLSS 5用的那个71层U-Net神经网络模型,被完整重新实现了一遍。靠的是VK_KHR_cooperative_matrix这个Vulkan扩展,直接在Intel Xe架构的XMX单元上跑起来。

这里有个技术坎儿。Xe2架构不支持FP8,所以整个模型只能降格用FP16精度来跑,累加还得用FP32。为了验证这套东西到底行不行,作者挑了三款格斗游戏做测试:《死或生5最后一战》《铁拳7》还有《真人快打1》。
性能这块儿,数据看着有点扎眼。就拿十年前出的《铁拳7》来说,在640×360这么小的分辨率下——也就1080p的九分之一大小——帧率才勉强摸到10.5帧。这速度,想流畅玩根本别指望。 其实DLSS 5的性能,几乎全看游戏输出的分辨率脸色。

在这颗锐炫140V上,要是按1080p算,光做一次DLSS 5推理就得花412毫秒。就算游戏画面渲染瞬间搞定,最高也就2.4帧。想在这么弱的硬件上凑合出点像样的帧率,只能拿极端低的分辨率去填坑。 画面效果嘛,得看游戏类型。
DLSS 5的NR模型本来就是冲着照片级写实去的。放在《真人快打》和《铁拳》这类作品里,效果还算讨喜。可一旦碰上画风偏动漫的《死或活》,模型就不太灵光了,把角色弄得显老气,看着反而别扭。