魔改 2080 Ti 跑 Qwen 3.8:NInfer 移植实现 456 tok/s
xrailgun · reddit · 2026-08-21
作者将原本针对 RTX 5090/Blackwell 的 C++/CUDA 推理引擎 NInfer 移植并调优到了 NVIDIA Turing 架构(sm75),具体目标是一块魔改版 22GB RTX 2080 Ti。
实测结果 (Qwen 3.8-27B MTP3, W8A16, Q8 KV):
- 标准自回归 (MTP0):约 25 tok/s。
- 推测解码 (MTP3, draft window=3):约 456 tok/s(接受率约 65%)。
- 显存占用:约 17.5 GiB,剩余 4.5-5.0 GiB 可供 KV Cache 使用,支持约 128k 上下文。
项目支持 OpenAI/Anthropic 兼容的 HTTP 服务(含流式输出与函数调用),代码已在 GitHub 开源。
「Infra」频道最新
- 设置 CPU Limit 会让 K8s 应用变慢?这里有复现实验与证明 — JeremyCMorgan · 2026-08-21
- AI 应用如何上生产?实战演练 OpenTelemetry 与值班 Agent — Al_Grigor · 2026-08-21
- LLMRouter 2.0:统一路由开发与评测基准 — youjiaxuan · 2026-08-21
- 12GB 显卡本地跑 MiniMax H3:15 秒多镜头视频模板 — vortis23 · 2026-08-21
- llama.cpp 新增 LFM2/MoE 模型张量切分支持,推理性能提升显著 — pmttyji · 2026-08-21
- 花千元购入二手 3090:本地 AI 性能碾压 3060,Qwen 35B 生成快 20 倍 — Yanzihko · 2026-08-21