绕过 NGX 架构门槛:在 Volta 老 V100 上跑通 DLSS 5 神经渲染
Ancient-Tomorrow-871 · reddit · 2026-09-26
发帖人把 NVIDIA DLSS 5 神经渲染搬进了 ComfyUI,并在官方 NGX 运行时不支持的 Volta 架构 V100 上跑通。核心思路是完全绕过 NGX/D3D12/ReShade/Wine,把网络作为纯 PyTorch 张量代码运行,权重提取在 CPU 上完成——架构门槛不是被绕过,而是根本不存在。
V100-SXM2-16GB 实测:
- 1920x1080:0.700 秒/帧,峰值显存 1732 MB
- 320x320:0.295 秒/帧,峰值 730 MB
- 约 0.83 GB 显存/百万像素输出
关于 FP8:网络在发布点将激活值四舍五入为 E4M3,PyTorch 的 float8 kernel 只支持 Ada 及更新架构,但由于这只是舍入步骤而非矩阵乘法,缺失的 FP8 tensor core 并不影响,SM 7.0 上正常工作。
注意事项:
- 这是重实现而非 NVIDIA 二进制:质量是「DLSS-5 风格」而非等同,权重布局部分靠逆向证据重建,未与原版输出做过数值等价验证
- 不 redistribution NVIDIA 的 dll,需用户自带 nvngxdlssnr.dll(--dll 参数传入)
- 不要链式多 pass:输出会收敛但累积的是色调偏移而非细节,应调 intensity 或 localstructurestrength
- 基于 levzzz5154/ComfyUI-DLSS5-PyTorch 与 iamwavecut/MLX-DLSS,作者新增了 Volta 兼容性分析与验证、安装工具和性能数据
项目开源于 GitHub:comfyui-dlss5-pre-rtx,Pascal/Maxwell 和 RTX 20-50 系理论上可用但未测试。
「Infra」频道最新
- Go 1.27 引入实验性 SIMD API,告别手写汇编 — arpit_bhayani · 2026-09-26
- 开发者大会总结:AI 编码正走向「智能体软件工厂」 — ahahabbak · 2026-09-26
- 16GB 内存跑 3 个 agent + 10 子代理,还剩 5GB 空闲 — Teknium · 2026-09-26
- 如何在生产环境落地机密计算?Reddit 求实践经验 — metalvendetta · 2026-09-26
- AI基建专家:25年来算力降价与边缘化从未缩小市场 — GregoryDiamos · 2026-09-26
- 100 GHz 锗光电探测器实测对比 Ghent 与 imec 方案,耦合损耗达 5 dB — jwt0625 · 2026-09-26