双 3090 跑通 Qwen 27B 全量上下文:3200 tok/min 实战配置

CryptographerLow7817 · reddit · 2026-08-23

作者分享了在双 RTX 3090(无 NVLink)上运行 Qwen3.8-27B 26.2万上下文 Coding Agent 的实战配置。通过 vLLM 0.27.1、MTP-3 推测解码和 GPU 前缀缓存,实现了约 96.8% 的缓存命中率。性能表现:首字延迟 (TTFT) 均值 6.5s(冷启动 140s),单会话解码速度 80-90 tok/s,多会话并发吞吐量约 3200 tok/min。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →