16GB 显存跑 27B 模型:NInfer 4080 推理引擎实测 262 tok/s

roofkid · reddit · 2026-10-04

一位有 20 年软件工程经验的开发者发布 NInfer 4080,让 ISTA-DASLab-Qwen-3.8-27B-GSQ 量化模型在 RTX 4080 的 16GB 显存上跑到 100k 上下文,prefill 峰值 2720 tok/s、生成 262 tok/s,并开源分享(GitHub: roofkid/ninfer-4080)。

关键做法

性能数据:98K 上下文下 prefill 1895 tok/s、DFlash2 K=7 解码 212 tok/s。作者感叹通用推理引擎为兼容性牺牲的性能远超预期。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →