12GB 显卡实测:Qwen3.8 27B Q2 可用,MoE 更优
CoffeeToCode99 · reddit · 2026-08-17
作者在 RTX 5070 Ti Laptop (12GB VRAM) 上对比了 Qwen3.8-27B (Dense, Q2/Q3) 与 Qwen3.6-35B-A3B (MoE, Q4) 的表现,结论如下:
测试环境
- 硬件: RTX 5070 Ti Laptop, 12GB VRAM.
- 后端: llama.cpp CUDA.
- 设置: 4k context, q8 KV, --fit on, no MTP.
关键发现
- Qwen3.8 Q2 (Dense)
- 速度较快 (Prompt 412 t/s, Gen 35.9 t/s)。
- 在基础测试中出现质量下降(如球拍问题答错),证明 Q2 量化有明显损耗。
- Qwen3.8 Q3 (Dense)
- 保持了基础测试的正确率 (6/6)。
- 但生成速度极慢 (仅 7.5 t/s),交互体验痛苦。
- Qwen3.6 35B-A3B (MoE)
- 正确率满分 (6/6)。
- 生成速度最快 (59 t/s),显著快于 Dense Q3。
结论
- 如果目标是“能不能跑”,Qwen3.8 Q2 确实能动。
- 如果目标是“日常聊天/编码”,35B-A3B MoE 仍是 12GB 显存下的最佳选择,兼顾了速度与质量。
「Infra」频道最新
- Wici One 声称通过 NVMe 流式传输解决本地显存瓶颈 — Torodaddy · 2026-08-17
- 单卡 5090 跑出每秒 206 token,Qwen3.8-27B 性能实测 — StefanoGogioso · 2026-08-17
- antirez优化DwarfStar:Station上170 t/s生成,22k tokens/s预填充 — antirez · 2026-08-17
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17
- 麦肯锡:自 22 年底美数据中心投资激增 200% — rvp · 2026-08-17
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17