RTX 3090 实测 ninfer:TTFT 从 3410ms 降到 29ms,PP 快 70 倍
milkipedia · reddit · 2026-09-11
作者在 RTX 3090 上对比自研推理栈 ninfer-3090 与 llama.cpp 跑两个 Qwen 模型的单线程 mini-benchmark,方法严谨(3 次重复取中位数、token 加权、加 nonce 防 prompt 缓存假热、预热不计入、优先服务端计时)。
核心结果:
- Qwen3.6-35B-A3B:ninfer TTFT 29ms vs llama.cpp 3410ms;PP 185,339 tok/s vs 2,440 tok/s(约 76 倍);TG 170.7 vs 148.6 tok/s。
- Qwen3.8-27B:ninfer TTFT 27ms vs 8160ms;PP 187,912 vs 1,013 tok/s;TG 34.9 vs 38.5 tok/s(略慢)。
结论:ninfer 在 TTFT 和 prompt 处理上「肉眼惊叹」——TTFT 从数秒降到几十毫秒,prompt 吞吐提升 1-2 个数量级,主要改变长 prompt 交互体验;生成速度则互有胜负。测试环境:Ubuntu 24.04,ninfer 0.6.1 vs llama.cpp dev build,对照组用 GGUF 量化(IQ4XS / Q4KM)。作者附上完整 7 个 prompt(400-12,900 tokens)的测试集与参数细节,欢迎同行复现和批评。
「Infra」频道最新
- 微软内部计划曝光:2032 年数据中心容量从 12GW 扩至 38GW — BenBajarin · 2026-09-11
- Oracle Q1 营收 193 亿美元超华尔街预期,AI 云需求持续走高 — Polymarket · 2026-09-11
- Agent 越强,GPU 之外的「普通计算」占比越大 — AccBalanced · 2026-09-11
- 2.78万亿参数 Kimi K3 单 CPU 跑通:仅需 8.24GB 内存、零 GPU — udmrzn · 2026-09-11
- 32GB M4 MacBook Air 上跑出 8-22 tok/s,Cherenkov 引擎刷新 Qwen3.8 极限 — alfredr · 2026-09-11
- Claude Desktop 数据直传大厂?用 Ollama 本地模型保住隐私 — Technovangelist · 2026-09-11