RTX 3090 部署 30B 模型实战:显存与量化级别的极限权衡

ydnar · reddit · 2026-08-11

开发者在 RTX 3090 (24GB) 上使用 llama-server 测试 Muse Glimmer 30B 模型,分享了具体的优化配置与思考。

配置详情

性能现状与探讨

在当前配置下,nvidia-smi 显示显存占用为 18163MiB / 24576MiB,仍有余量。作者初步测试发现其在编程和逻辑任务上优于 Qwen 27B。

作者向社区提问:是应该尝试提升量化精度到 UD-Q5KXL 以获得更好效果,还是维持 Q4 以追求更高的 tokens/s 吞吐量?

所属事件:单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →