求助:2x3060 上 llama.cpp 跑 Qwen3.8-Flash-Next 仅 15 tok/s

Dreeew84 · reddit · 2026-10-12

作者在 2x RTX3060 12GB + 64GB RAM 上用 vanilla llama.cpp 跑 Qwen3.8-Flash-Next IQ3XXS,仅约 15 tok/s,远低于 Strata 的 35-50 tok/s。问题包括:找不到 Strata 使用的 800MB mtp q20 drafter(HF 上只有 3.5 倍大的 Q4KM 版,反而拖慢解码);tensor split 在 dense 模型可用但 Flash-Next 报 cudaMalloc 失败,llama 似乎把双 12GB 当成单张 24GB 处理。作者求分享可用的 llama 配方。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →