Qwen3.8-27B在16GB显存跑出50tok/s,附详细配置

brainExploded99 · reddit · 2026-08-19

Reddit用户分享在Nvidia 5070Ti 16GB VRAM上运行Qwen3.8-27B的经验,通过移除MTP层和优化配置,实现85k上下文、50tok/s生成速度。提供了完整配置文件和优化建议,如使用q8缓存、调整ubatch-size等。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →