EXL3 量化实测:12GB 显存流畅运行 30B 模型

PyaesoneP · reddit · 2026-08-30

作者分享了在 12GB 显存设备上运行 Muse Glimmer 30B EXL3-SC 3.00bpw H4 模型的经验。实测显示该模型在 100K 上下文下完全驻留显存,推理速度约 30 tok/s,且作为 Hermes Agent 使用时与官方 17GB 量化版质量差异不明显。作者对比了 Qwen 3.8 27B 的 SC2.20bpw H3 量化版,认为可用但仍偏好 Unsloth 量化版用于编码任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →