四卡 3090 跑 Qwen3.8-Flash-Next,自建 P2P 驱动冲到 361.7 tok/s
QuixiAI · x · 2026-09-07
开发者 QuixiAI 宣布在 Quad 3090 上通过自研推理服务 SlimServe 跑通 nvidia/Qwen3.8-Flash-Next-NVFP4,并继续做性能优化。实测吞吐为单并发 120 tok/s、8 并发 361.7 tok/s。关键在于其自写的开源 P2P 内核驱动(QuixiAI/open-gpu-kernel-modules),用于跨卡点对点通信加速多卡推理。
所属事件:Eric Hartford fork NVIDIA 驱动解锁消费卡 P2P,开源 SlimServe(10 条相关)→
「Infra」频道最新
- 传AWS将2026年资本开支上调至2200亿美元,加速抢购AI服务器机柜 — firstadopter · 2026-09-07
- Together AI 签下行业最大开源基建协议:25 万芯片、年约 50 亿美元 — togethercompute · 2026-09-07
- 研究拆解 Firecracker jailer 安全层:io_uring 成隔离边界软肋 — jedisct1 · 2026-09-07
- Perplexity 转向端侧:敏感数据交给本地小模型处理 — HowDevelop · 2026-09-07
- Merge Gateway 推出 DeepSeek V4 Flash 七五折:输入每百万 token 仅 4 美分 — shensi · 2026-09-07
- Qwen 3.8 Flash Next 量化版上 M3 Ultra 跑出 65 tokens/s — ivanfioravanti · 2026-09-07