求助:2x3060 上 llama.cpp 跑 Qwen3.8-Flash-Next 仅 15 tok/s
Dreeew84 · reddit · 2026-10-12
作者在 2x RTX3060 12GB + 64GB RAM 上用 vanilla llama.cpp 跑 Qwen3.8-Flash-Next IQ3XXS,仅约 15 tok/s,远低于 Strata 的 35-50 tok/s。问题包括:找不到 Strata 使用的 800MB mtp q20 drafter(HF 上只有 3.5 倍大的 Q4KM 版,反而拖慢解码);tensor split 在 dense 模型可用但 Flash-Next 报 cudaMalloc 失败,llama 似乎把双 12GB 当成单张 24GB 处理。作者求分享可用的 llama 配方。
「Infra」频道最新
- 工程师晒入职满月动态:加入英伟达做 Groq LPU 编译器 — blelbach · 2026-10-12
- Linus Ekenstam 立目标:要在手机上跑千亿参数模型 — LinusEkenstam · 2026-10-12
- Brookings:AI 建设融资十年将耗 10.3 万亿美元,占 GDP 3.63% — KyeGomezB · 2026-10-12
- Fireworks 实战:开源模型加微调可追平闭源,Cursor 推理快 13 倍 — AI Engineer · 2026-10-12
- 456GB 大模型塞进 192GB 显存:混合 offload 推理实测跑通 — HankYeomans · 2026-10-12
- VitalOps 上线:智能体自动优化推理栈,实测提速 2.6 倍 — abhijithneil · 2026-10-12