软件神优化:四张 V100 跑平 RTX 5090 运行 Qwen 3.8

Simple_Library_2700 · reddit · 2026-08-19

开发者通过编写 QPN 内核,让 2017 年的 Tesla V100(原本不支持 FP4/FP8)能够原生运行 Qwen 3.8 的 NVFP4 权重。在单请求解码测试中,四张 V100 的吞吐量(219.1 tok/s)甚至略超 RTX 5090(214.7 tok/s),达成性能 parity。其核心原理是在读取 HBM 时即时解量化并适配 Volta 的 Tensor Core,通过增加每轮验证的 token 数(5.89 vs 4.27)弥补了单轮延迟劣势。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →