软件神优化:四张 V100 跑平 RTX 5090 运行 Qwen 3.8
Simple_Library_2700 · reddit · 2026-08-19
开发者通过编写 QPN 内核,让 2017 年的 Tesla V100(原本不支持 FP4/FP8)能够原生运行 Qwen 3.8 的 NVFP4 权重。在单请求解码测试中,四张 V100 的吞吐量(219.1 tok/s)甚至略超 RTX 5090(214.7 tok/s),达成性能 parity。其核心原理是在读取 HBM 时即时解量化并适配 Volta 的 Tensor Core,通过增加每轮验证的 token 数(5.89 vs 4.27)弥补了单轮延迟劣势。
「Infra」频道最新
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24
- 三星展示 HBM 散热新方案,芯片性能存差异 — BenBajarin · 2026-08-24
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24