QuixiAI 解锁消费卡 P2P 互连,8 张 3090 跑通 262K 上下文
QuixiAI 的 Eric Hartford(Dolphin/Samantha 作者)公开了 NVIDIA 开放 GPU 内核模块(驱动 610.57.04)的 fork,为 GeForce 消费级显卡启用 PCIe 点对点(P2P)互连,已验证支持 RTX 3090(GA102)、4090 和 5090。
已确认
- Eric Hartford 定位并修复了 NVIDIA 对消费卡多卡 P2P 直连的软件限制,并提交了补丁;但他预计该改动不会被合并上游(upstream),暗示这是官方有意为之的人为阉割
- 基于 fork 的 P2P 互连,其开源推理项目 SlimServe(基于 ds4/vllm)在 8 张 RTX 3090(共 192 GB 显存、无 FP8、无 NVLink)上以原生 262,144 token 上下文服务 Qwen3.8-Flash-Next:并发 1 约 140 tok/s,批量 C32 约 1200 tok/s
- 4 张 RTX 3090 上运行 Qwen3.8-Flash-Next-NVFP4(nvidia 量化版):并发 1 约 120 tok/s,并发 8 达 361.7 tok/s
- Eric Hartford 详细复盘了 8 卡方案的实现过程,强调用五年前的消费级硬件达成企业级长上下文推理能力
尚未确认
- 补丁能否被 NVIDIA 官方驱动主线接受仍未知,作者本人持悲观态度
- fork 在更大规模部署或非 3090/4090/5090 卡上的稳定性尚待更多验证
为什么重要
- 若 NVIDIA 确实通过软件手段限制消费卡多卡性能,该 fork 为预算有限的研究者和小团队提供了低成本长上下文推理路径
- 8 张二手 3090 即可承载 262K 上下文并达到千级 tok/s 吞吐,显著拉低了大上下文服务的门槛
2026-09-06 ~ 2026-09-07 · 6 条相关
一手来源
- SlimServe 让 8 张 3090 跑 Qwen 3.8 Flash Next,解码达 1200 tok/s — QuixiAI · 2026-09-06
- 【源头】Eric Hartford 开源 fork:为 RTX 3090/4090/5090 消费卡解锁 P2P 互连 — QuixiAI · 2026-09-06
- 开发者称修复了 NVIDIA 消费卡多卡 P2P 人为阉割 — QuixiAI · 2026-09-06
- 【源头】8 张 RTX 3090 跑 262K 上下文,Qwen3.8-Flash-Next 达 1200 tok/s — QuixiAI · 2026-09-06
- 【源头】Quad 3090 跑 Qwen3.8-Flash-Next-NVFP4,单卡 120 tok/s — QuixiAI · 2026-09-07
- 开源 P2P 驱动让 GeForce 消费卡支持多卡互联,已验证 3090/4090/5090 — QuixiAI · 2026-09-07