四卡 3090 跑 Qwen3.8-Flash-Next,自建 P2P 驱动冲到 361.7 tok/s

QuixiAI · x · 2026-09-07

开发者 QuixiAI 宣布在 Quad 3090 上通过自研推理服务 SlimServe 跑通 nvidia/Qwen3.8-Flash-Next-NVFP4,并继续做性能优化。实测吞吐为单并发 120 tok/s、8 并发 361.7 tok/s。关键在于其自写的开源 P2P 内核驱动(QuixiAI/open-gpu-kernel-modules),用于跨卡点对点通信加速多卡推理。

所属事件:Eric Hartford fork NVIDIA 驱动解锁消费卡 P2P,开源 SlimServe(10 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →