EXL3 量化实测:12GB 显存流畅运行 30B 模型
PyaesoneP · reddit · 2026-08-30
作者分享了在 12GB 显存设备上运行 Muse Glimmer 30B EXL3-SC 3.00bpw H4 模型的经验。实测显示该模型在 100K 上下文下完全驻留显存,推理速度约 30 tok/s,且作为 Hermes Agent 使用时与官方 17GB 量化版质量差异不明显。作者对比了 Qwen 3.8 27B 的 SC2.20bpw H3 量化版,认为可用但仍偏好 Unsloth 量化版用于编码任务。
「编程与Agent」频道最新
- 智能体SDLC:工程师从实施者转为编排者 — Pavan_Belagatti · 2026-08-30
- Agent 在沙盒正常却生产环境报错,如何测试? — Common_Dream9420 · 2026-08-30
- TrustScoreAgent:给 Agent 的服务信誉注册表 — TrustScoreAgent · 2026-08-30
- 做 Agent 记忆层:瓶颈不在模型而在基础设施 — shbong · 2026-08-30
- Arcturus Bot 接入 GPT-image-2,展示群聊图像生成实例 — MikePFrank · 2026-08-30
- 技术解析:在边缘设备实现 ColBERT 风格的超维度记忆门控 — Equivalent-Flan-1590 · 2026-08-30