12GB 显存跑通 Qwen3.8-Flash-Next 125B MoE,MTP 加持逼近 21 tok/s
carteakey · reddit · 2026-09-15
作者在 RTX 4070 12GB + 64GB DDR5-5600 + Gen4 NVMe 的 Linux 机器上跑 Qwen3.8-Flash-Next(125B-A6B MoE + 51B n-gram 表),从最初 6 tok/s 优化到接近 20 tok/s,认为这是该配置下能做到的最强智能。作者称其多数任务上超过 27B 稠密模型,适合低显存高内存配置。
关键做法:
- 用 AtomicChat 的 4.27 bpw GGUF 量化
- n-gram SSD offloading(lazy-mode)
- --fit on --fit-target 512 自动选参
- 主分支 19.35 t/s;应用 MTP PR #28243 + Compact MTP 共享头(1.78GB, Q4KM)加 -ncmoe 45,接受率 77-96%,各任务均突破 20 t/s(峰值 20.65)
- 注意低显存下 MTP 收益有限,需牺牲几层存放 MTP 头
- 处理速度(PP)仅 300-350 tok/s
「Infra」频道最新
- 研究者开源 theseus:用人类语言做神经网络架构研究 — pratyusha_PS · 2026-09-15
- 用500年历史教训反驳「禁数据中心救世界」论 — thursdai_pod · 2026-09-15
- 把运行中的整机一秒克隆 32 份,让 agent 团队不再受算力瓶颈 — bigaiguy · 2026-09-15
- 扎克伯格公开喊话 Nvidia:求短线 DGX Station 跑本地模型 — beffjezos · 2026-09-15
- BIS 年报遭逐条拆解:H20 限制无正式规则、实体清单停摆、漏洞未堵 — ohlennart · 2026-09-15
- iOS 27 端侧模型 AFM 3 总参数 20B,动态激活仅 1-4B — rxwei · 2026-09-15