16GB 显存跑 Qwen3.8 27B:DFlash2 草稿模型实测 60 tok/s
pneuny · reddit · 2026-09-12
- 作者用 DFlash2 草稿模型(HermiHg/Qwen3.8-27B-DFlash2-Q2KS-MIX-GGUF)搭配 IQ3XXS 主模型、131k 上下文,在 16GB RX 9070 XT 上达到平均约 60 tokens/s 的生成速度。
- 比内置 MTP 投机解码更省显存——内置 MTP 会成倍增加 VRAM 需求;单线程模式下这是 16GB 显卡上的最优选择之一。
- 注意事项:投机解码对显存溢出更敏感,一旦超出实际显存,关闭投机解码反而更快(DDR5 PCIe 5 平台实测)。
- HuggingFace 讨论区有其他人在不同显卡上的更详细测试。
「Infra」频道最新
- 玻璃基板无加强筋翘曲改善超2倍,成AI封装新方向 — jwt0625 · 2026-09-12
- d-Matrix 携手 NVIDIA:Raptor XPU 接入 NVLink Fusion 机架级系统 — bookwormengr · 2026-09-12
- 300K 上下文也扛不住大代码库,本地长任务如何自动交接 — Developer-Y · 2026-09-12
- 经济学人:英伟达已成「AI 的中央银行」 — tolugenius · 2026-09-12
- 24GB M5 MacBook Air 离线跑 LLM,选哪个 MoE 够快够好 — itis_whatit-is · 2026-09-12
- DeepSeek v4.1 Flash 本地实测:q2 量化 16 tok/s,工具调用选错率高 — challis88ocarina · 2026-09-12