实测 Qwen3.8 在双节点 DGX 上达 181 tok/s 吞吐
StartupTim · reddit · 2026-08-29
开发者在 2 节点 NVIDIA DGX Spark (GB10) 上成功部署 Qwen3.8-Flash-Next,通过一系列优化实现了 181 tok/s 的聚合吞吐量(约 9 个并发 Agent 会话),单流解码速度为 30-50 tok/s。
关键优化与配置:
- 模型量化与扩展:使用 RadixArk NVFP4 量化,通过 YaRN 将上下文从 262K 扩展至 512K 并通过 needle 测试。
- NVMe 卸载大表:将 47.7 GB 的 n-gram 嵌入表留在 NVMe 上,通过 madvise(MADVRANDOM) 修正读放大问题,节省显存用于 KV Cache(从 65GB 降至 41GB)。
- vLLM 调优:开启 prefix caching(99% 命中率),设置 MTP 推测解码(k=3),并手动 pin KV Cache 内存以防 OOM。
- 显存管理:限制了并发长 prefill 数量以保护主存,特别是在统一内存架构下。
「编程与Agent」频道最新
- 一眼识别 AI 生成前端:它把系统知道的一切都摊给用户 — aryanXmahajan · 2026-08-29
- Hiten Shah 分享用本地 AI 做 QA 测试与修复 Bug 实战 — msg · 2026-08-29
- 播客预告:hnshah 的「图书管理员」bot 如何自动整理 GitHub 仓库 — msg · 2026-08-29
- 连续创始人 Hiten Shah:用 Grok Bot 组建研究、营销与资料库机器人团队 — msg · 2026-08-29
- 解决 Agent 记忆冲突:基于时间戳的事实替换机制 — PrajwalTomar_ · 2026-08-29
- 用 Codex 开发游戏最终耗尽内存 — CtrlAltDwayne · 2026-08-29