Qwen 3.8 27B 量化版在 16GB 显存实现 20 万上下文

abskvrm · reddit · 2026-08-28

用户在 16GB VRAM 设备上成功运行 Qwen 3.8 27B UD-IQ3XXS 模型,实现了超过 20 万的上下文窗口。与之前使用的 UD-Q3KXL 相比,虽然提示处理速度从 700-800 tk/s 下降到了 400 tk/s,但质量尚未经详细测试。KV Cache 均量化为 q51。

所属事件:Qwen 3.8 27B 量化实测:低显存跑超长上下文(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →