16GB 显存跑通 Qwen 3.8 Flash Next 130k 上下文,速率 15-20 t/s
AvidCyclist250 · reddit · 2026-09-24
作者在一周测试后分享了在 4080(16GB VRAM)+ 64GB RAM 上跑 Qwen 3.8 Flash Next 的完整配置,在 130k 上下文下达到 15-20 t/s。
他强调四个常被忽略的关键点:选对量化(AtomicChat AD-4.27bpw / Q4KM 目标)、选对模型(含共享的 Unsloth MTP 头)、选对分支(用其 pr-mtp-fix 分支,需 llama.cpp PR #28243 加一个修复 commit,master 尚不能加载该 MTP 头)、选对缓存参数(q8 KV cache)。
核心技巧是 --spec-draft-cpu-moe:把投机解码的 draft experts 放进内存,让目标模型的热点 experts 留在 GPU 上。相比 IQ4XS 的约 10 t/s,这套配置在 131k 上下文下达到 16.5 t/s 生成 / 350 t/s 预填充。配置细节见 GitHub 仓库。
「Infra」频道最新
- DuckDB 首次内置进 dbt v2,基于 Rust Fusion 引擎发布 — josh_wills · 2026-09-24
- Epoch 测算:AI 性能成本每季度降 47%,价格跌幅史上最快 — RishiBommasani · 2026-09-24
- 马斯克晒首批自产镍正极 Cybercab,美洲首座正极厂落地得州 — elonmusk · 2026-09-24
- 曝 OpenAI 效率布局:GPT-6 Luna 主打性价比,Sol 低价保留多数智能 — haider1 · 2026-09-24
- FT:科技巨头一年内为 AI 芯片与数据中心提供近 3000 亿美元担保 — FinanceYF5 · 2026-09-24
- Ornn数据:Token价格普跌而GPU租金大涨,价值流向算力持有者 — FinanceYF5 · 2026-09-24