RTX 3090 部署 30B 模型实战:显存与量化级别的极限权衡
ydnar · reddit · 2026-08-11
开发者在 RTX 3090 (24GB) 上使用 llama-server 测试 Muse Glimmer 30B 模型,分享了具体的优化配置与思考。
配置详情
- 模型:unsloth/Muse-Glimmer-30B-GGUF:UD-Q4KXL
- 上下文:131072
- 缓存:K/V cache 使用 q80,开启 Flash Attention。
- 生成参数:temp 1.0, top-k 64, top-p 0.95。
性能现状与探讨
在当前配置下,nvidia-smi 显示显存占用为 18163MiB / 24576MiB,仍有余量。作者初步测试发现其在编程和逻辑任务上优于 Qwen 27B。
作者向社区提问:是应该尝试提升量化精度到 UD-Q5KXL 以获得更好效果,还是维持 Q4 以追求更高的 tokens/s 吞吐量?
所属事件:单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(8 条相关)→
「Infra」频道最新
- 单卡 RTX 5090 四夜训练 EAGLE-3 投机解码头,Gemma-3-27B 推理提速超 50% — max_paperclips · 2026-08-11
- 推演AI算力极限:免费能源与Kimi K5将催生5万亿美元市场 — MarvinTBaumann · 2026-08-11
- Google Cloud 营收飙升 82%,5140 亿订单印证 AI 需求 — DavidLinthicum · 2026-08-11
- 单卡跑 MiniMax-H3:六种本地优化方案盲测横评 — Primary-Confusion504 · 2026-08-11
- RTX 5090 实测:Glimmer 模型本地推理破 233 tps — YetAnotherAnonymoose · 2026-08-11
- 教授指出 AI 数据中心打破传统工业革命的地方经济权衡 — emollick · 2026-08-11