12GB 显存笔记本跑 Qwen3.8:Strata 引擎 51t/s,预填充 1500t/s
MLDataScientist · reddit · 2026-09-30
用户实测新推理引擎 Strata,在 12GB 显存笔记本(5070ti 12GB + 64GB DDR5)上跑 ISTA-DASLab 的 Qwen3.8 Flash Next GGUF 量化版,速度远超 llama.cpp:
- 生成速度:43k 上下文深度下达 51 t/s,同量化下原版 llama.cpp 只有 23 t/s;整体测得 50 t/s TG / 1500 t/s PP。
- 预填充:32k 上下文读取达 1500 t/s,原版 llama.cpp 同量化仅约 100 t/s,差距 15 倍。
- 显存占用:约 11GB VRAM + 56GB RAM(含系统),量化版可在 8bit 下加载至 200k 上下文,作者用到 131k。
限制:引擎目前专为这一款模型打造,只有 ISTA-DASLab 的部分 GGUF 可用;官方称其 IQ3S 量化可在编码基准上恢复全量模型性能,作者实测 IQ3XXS 质量也不错。仅支持 NVIDIA,AMD 支持为实验性;早期 kv cache bug 已被开发者修复。作者感叹 12GB 显存笔记本如今能本地跑半年前的旗舰模型。
「Infra」频道最新
- 亚洲输美空运货物 8% 是数据中心配件,每天 30 架全货机 — yacineMTB · 2026-09-30
- 2x 4060 8GB 跑 Gemma 26B:mradermacher 量化实现 75 tok/s — Spiritual_Impress_30 · 2026-09-30
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- Altman:OpenAI 自研芯片 2027 上半年上线,押注推理优势 — johncoogan · 2026-09-30
- 网友爆料:DeepSeek 新模型疑为华为昇腾训练 — teortaxesTex · 2026-09-30
- AAOI 美国垂直整合过激:激光器产线良率仍差,烧掉大量资本开支 — jwt0625 · 2026-09-30