带视觉仅 17GB:Swift-Qwen3.8-27B GGUF 在双 5060 Ti 上实测 76 tok/s
Then_Blueberry7290 · reddit · 2026-09-28
一位本地部署玩家发现 LuffyTheFox 的 Swift-Qwen3.8-27B-Genesis-GGUF:带视觉能力却不到 17GB,比同类 NVFP4 量化版(通常 19-20GB+)更小,可在 32GB 显存里塞满 262k 上下文,视觉投影器放内存。
在 2×5060 Ti 16GB OC 上用 llama.cpp 实测:262k 上下文基准速度 76 tok/s(40-113 区间),日常 agentic 工作负载 45-65 tok/s。对比之下 thinkingcap 的 NVFP4 版在 vLLM 里只能开 160k 上下文且无法把 mmproj 卸到内存。作者认为质量与其他 swift NVFP4 模型相当,但发帖询问这个更小的版本牺牲了什么。
「Infra」频道最新
- 云南锗业财报:InP 原料铟本土供应紧张,放开管制也无货可出 — pstAsiatech · 2026-09-28
- Apple 端侧模型 fm 搭决策小模型 Jev,路由测试全对比 — jasonkneen · 2026-09-28
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- 6 张 RTX 6000 满血 325W 长期运行, GPU 温度仅 41°C — TheZachMueller · 2026-09-28
- RTX 3090 本地跑 MiniMax H3 视频生成:每步 6294 秒还翻车 — play150 · 2026-09-28
- 16GB 显卡跑 177B MoE:SSD 流式推理实测 9-10 tok/s — TypicalPudding6190 · 2026-09-28