自研推理引擎让 12GB 显存跑 Qwen3.8-Flash-Next 达 65 tok/s

KnownAd4832 · reddit · 2026-09-25

作者此前用 IQ3XXS 量化在 12GB RTX 5070 上跑 Qwen3.8-Flash-Next 只有 15 tok/s 输出。之后他专门针对这个模型和这台电脑自研了一个推理引擎(Strata,已开源,一键安装,目前仅优化 CUDA),同一量化下输出速度提升到约 65 tok/s,prompt 处理约 430 tok/s,2-bit 量化用 RCO-GSQ 方案还能更快。

硬件配置:64GB DDR5-5600 + RTX 5070 SFF + Ryzen 5 7600,Windows。128K 上下文下的实测:

模型来自 ISTA-DASLab 发布的 GGUF 量化版本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →