单卡 R9700 跑 Qwen3.8-Flash-Next:230k 上下文下 863 t/s prefill、35 t/s 解码
Designer_Elephant227 · reddit · 2026-10-02
Reddit 用户分享在单张 AMD R9700 上用 exllamav3(rocm fork)本地运行 Qwen3.8-Flash-Next 的完整配置与速度数据,征求调优建议。
- 模型:turboderp 的 exl3 5.05 bpw 量化(head/vision 6 bit、mtp 5 bit)
- 混合专家卸载:每层 512 个专家中 112 个在 GPU,其余 400 个在 CPU(16 线程);102GB bf16 ngram 表从 NVMe 流式读取
- 262k 上下文、q8 KV cache、chunk 4096,MTP drafting 开启(接受率约 53-54%)
- 实测 230k 上下文散文:prefill 863 t/s(101k 新 token,其余走 prefix cache)、解码 34.7 t/s
- 对 gfx12 需自行 patch 一个文件
「Infra」频道最新
- Neocloud 现实检验:下一个 AI 项目为何可以绕开大型云厂商 — DavidLinthicum · 2026-10-02
- 开源模型上手三步指南:从选型到本地部署再到接入工具 — every · 2026-10-02
- 社区优化赛跑出 1900 tps prefill,较基线提速约 2.5 倍 — HankYeomans · 2026-10-02
- 圣安东尼奥一个选区超 12 座数据中心,隐身树林能躲过反对吗 — The Verge AI · 2026-10-02
- 等不了长合约?RunPod 等 GPU 自助云可即时开通算力 — DavidLinthicum · 2026-10-02
- AWS CEO 发 3000 字长文警告:阻挠数据中心将重创美国经济与安全 — The Verge AI · 2026-10-02