实测 Qwen3.8-27B 在 16GB 显存下的 13 万上下文性能

BuffMcBigHuge · reddit · 2026-08-20

作者在 RTX 4080 16GB 上测试了 Qwen3.8-27B 模型的长上下文性能。通过使用 llama.cpp 的 DFlash2 分支、ngram-mod 采样策略以及 MTP (Medusa Thought Proposal) 推测解码技术,成功在保持推理速度的同时将上下文长度扩展至 131k。文章对比了不同配置(如 IQ3XXS 量化、缓存设置)的效果,并提供了完整的启动命令参数。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →