双3090实测Qwen3.8-27B:20万上下文与F16 KV部署细节

Sisuuu · reddit · 2026-08-15

用户在双 RTX 3090 (24GB2) 上实测了 Qwen3.8-27B 的 Q8KXL 量化版,成功开启了 200K 上下文窗口,并保留了 F16 KV Cache 和视觉能力。文章详细解释了因混合架构(64层中16层全注意力+48层线性注意力)带来的内存节省与配置挑战,分享了针对 llama.cpp 的完整启动参数(含 Speculative Decoding 设置),并指出在当前硬件限制下,为保证稳定性需预留约 10% 的显存偏移空间,最终实现了代码 73 tok/s、散文 58 tok/s 的生成速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →