16GB 显存跑 27B 模型:NInfer 4080 推理引擎实测 262 tok/s
roofkid · reddit · 2026-10-04
一位有 20 年软件工程经验的开发者发布 NInfer 4080,让 ISTA-DASLab-Qwen-3.8-27B-GSQ 量化模型在 RTX 4080 的 16GB 显存上跑到 100k 上下文,prefill 峰值 2720 tok/s、生成 262 tok/s,并开源分享(GitHub: roofkid/ninfer-4080)。
关键做法
- 采用 DFlash2 投机解码 + MTP3,大幅压榨通用引擎(llama.cpp/vllm)留在桌面上的性能:初始显存吞吐仅 200 GB/s(理论峰值 720 GB/s)令他震惊
- KV 量化换取长上下文,可按需在精度与上下文间切换;MBPP 保持 90-92%、HumanEval 95-96%,损失在测量噪声内
- 开发工作主要交给 DeepSeek V4.1 Flash(约 $13 额度),Pi 作 harness,提供 Docker 镜像方便复现
性能数据:98K 上下文下 prefill 1895 tok/s、DFlash2 K=7 解码 212 tok/s。作者感叹通用推理引擎为兼容性牺牲的性能远超预期。
「Infra」频道最新
- uv 作者自曝 fork 版工具链回放快 33%,磁盘省 60% — mitsuhiko · 2026-10-04
- 训练不稳别怪 fp16:cuDNN/FA4 反向传播精度有严重 bug — bdsqlsz · 2026-10-04
- RWKV-7 G1k 发布:纯 RNN 无 KV cache,13B 推理仅靠 16M 状态 — cephaloform · 2026-10-04
- NeoCloud Summit 2026 将在旧金山办,GPU 原生云生态全员到齐 — AccBalanced · 2026-10-04
- Modal 工程师复用 K8s Reconciler 模型造 Gang Scheduler — emilyzsh · 2026-10-04
- 面对数据中心抗议潮,AWS CEO 称亚马逊已不再使用保密协议 — TechCrunch AI · 2026-10-04