魔改 2080 Ti 跑 Qwen 3.8:NInfer 移植实现 456 tok/s

xrailgun · reddit · 2026-08-21

作者将原本针对 RTX 5090/Blackwell 的 C++/CUDA 推理引擎 NInfer 移植并调优到了 NVIDIA Turing 架构(sm75),具体目标是一块魔改版 22GB RTX 2080 Ti。

实测结果 (Qwen 3.8-27B MTP3, W8A16, Q8 KV):

项目支持 OpenAI/Anthropic 兼容的 HTTP 服务(含流式输出与函数调用),代码已在 GitHub 开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →