RTX 3090 实测 ninfer:TTFT 从 3410ms 降到 29ms,PP 快 70 倍

milkipedia · reddit · 2026-09-11

作者在 RTX 3090 上对比自研推理栈 ninfer-3090 与 llama.cpp 跑两个 Qwen 模型的单线程 mini-benchmark,方法严谨(3 次重复取中位数、token 加权、加 nonce 防 prompt 缓存假热、预热不计入、优先服务端计时)。

核心结果:

结论:ninfer 在 TTFT 和 prompt 处理上「肉眼惊叹」——TTFT 从数秒降到几十毫秒,prompt 吞吐提升 1-2 个数量级,主要改变长 prompt 交互体验;生成速度则互有胜负。测试环境:Ubuntu 24.04,ninfer 0.6.1 vs llama.cpp dev build,对照组用 GGUF 量化(IQ4XS / Q4KM)。作者附上完整 7 个 prompt(400-12,900 tokens)的测试集与参数细节,欢迎同行复现和批评。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →