双 3090 跑通 Qwen 27B 全量上下文:3200 tok/min 实战配置
CryptographerLow7817 · reddit · 2026-08-23
作者分享了在双 RTX 3090(无 NVLink)上运行 Qwen3.8-27B 26.2万上下文 Coding Agent 的实战配置。通过 vLLM 0.27.1、MTP-3 推测解码和 GPU 前缀缓存,实现了约 96.8% 的缓存命中率。性能表现:首字延迟 (TTFT) 均值 6.5s(冷启动 140s),单会话解码速度 80-90 tok/s,多会话并发吞吐量约 3200 tok/min。
「编程与Agent」频道最新
- Agent 谎言传播如野火,开发者禁写历史防崩溃 — Vjeux · 2026-08-23
- Agent 群体易陷入幻觉传播与死循环困境 — Vjeux · 2026-08-23
- 开发者分享 Agent 技能:项目现实审查工作流 — doodlestein · 2026-08-23
- 微软发布 LangChain.js 入门教程课程 — adnan_hashmi · 2026-08-23
- DeepSeek 涨价后,当下高性价比 Agent 方案求推荐 — ProudCordonian · 2026-08-23
- 接 DeepSeek V4 Pro 绕过 Claude 版权限制做追剧插件 — AlchainHust · 2026-08-23