16GB RTX 5080 跑 Qwen 3.8 27B:NInfer 调优后解码 96 t/s、11 万上下文

Kernoriordan · reddit · 2026-10-07

作者继此前用 llama.cpp 在 16GB RTX 5080 上跑出约 75 t/s 后,改用 NInfer v1.5 进一步调优,在 Ubuntu 24.04/WSL2 下实现 90–110 t/s 解码、分配 110,592 上下文。

实测数据(32 次 Zoo Code 编码请求)

关键配置

踩坑

作者尚未做与 GGUF 方案的质量对比,欢迎交流 16GB 卡上的 NInfer 设置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →