带视觉仅 17GB:Swift-Qwen3.8-27B GGUF 在双 5060 Ti 上实测 76 tok/s

Then_Blueberry7290 · reddit · 2026-09-28

一位本地部署玩家发现 LuffyTheFox 的 Swift-Qwen3.8-27B-Genesis-GGUF:带视觉能力却不到 17GB,比同类 NVFP4 量化版(通常 19-20GB+)更小,可在 32GB 显存里塞满 262k 上下文,视觉投影器放内存。

在 2×5060 Ti 16GB OC 上用 llama.cpp 实测:262k 上下文基准速度 76 tok/s(40-113 区间),日常 agentic 工作负载 45-65 tok/s。对比之下 thinkingcap 的 NVFP4 版在 vLLM 里只能开 160k 上下文且无法把 mmproj 卸到内存。作者认为质量与其他 swift NVFP4 模型相当,但发帖询问这个更小的版本牺牲了什么。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →