16GB RTX 5080 跑 Qwen 3.8 27B:NInfer 调优后解码 96 t/s、11 万上下文
Kernoriordan · reddit · 2026-10-07
作者继此前用 llama.cpp 在 16GB RTX 5080 上跑出约 75 t/s 后,改用 NInfer v1.5 进一步调优,在 Ubuntu 24.04/WSL2 下实现 90–110 t/s 解码、分配 110,592 上下文。
实测数据(32 次 Zoo Code 编码请求)
- 中位解码速度 96.45 t/s(最低 84.6,最高 131.7)
- 中位首 token 时间 1.4 秒,多数轮次命中 prompt 缓存
- 实际会话 prompt 增长到 77–79k tokens
关键配置
- 权重约 11.86 GiB,启动后仅余 498 MiB;prefill chunk 降至 896 才塞下
- KV cache 用 q4,MTP 投机解码(draft 3 tokens,接受率 58–67%),thinking budget 2048
- 生成 token 中约 68% 是推理 token;丢失 prompt 缓存时重新处理 79k prompt 需近 50 秒
踩坑
- Zoo Code 的 base URL 必须带 /v1,否则 404
- Zoo Code 会发送 high reasoning effort(设置显示 medium),NInfer 会拒绝,需在客户端禁用
作者尚未做与 GGUF 方案的质量对比,欢迎交流 16GB 卡上的 NInfer 设置。
「Infra」频道最新
- NVIDIA 直播演示 DGX Spark 混合 AI 智能路由方案 — NVIDIAAI · 2026-10-07
- DGX Station 外接一张 RTX Pro 6K:DeepSeek V4.1 Flash 预填冲上 6 万 tok/s — Sentdex · 2026-10-07
- Hugging Face 工程师演讲:llama.cpp 与本地 AI 推理生态全景 — unofficialmerve · 2026-10-07
- 谷歌签 20 年核电大单,Constellation 股价单日暴涨 14% — Polymarket · 2026-10-07
- 互联网根密钥 10 月 11 日换签,Cloudflare 详解 DNSSEC KSL 轮换与检测方法 — Cloudflare Blog · 2026-10-07
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07