双 3090 跑通 Qwen3.8-27B:DFlash2 加速实测与全流程配置

Old_Ad_6033 · reddit · 2026-08-29

Reddit 用户分享了在双 RTX 3090 (24GB) 上部署 Qwen3.8-27B INT4 量化模型的完整方案。通过 vLLM 0.28.0 + LMCache + DFlash2 技术栈,利用 NVMe 做二级 KV 缓存,成功实现了 256k 上下文支持。实测显示,开启 DFlash2 后,Code 任务解码速度达 268 tok/s(提升 3.8 倍),真实 Agent 任务达 165 tok/s。作者详细列出了环境配置、LMCache 服务启动命令及 vLLM 启动参数,并指出需应用特定补丁以避免缓存损坏。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →