Qwen3.8-27B 推理优化:RTX 3090 跑出 1150 tps
iamMess · reddit · 2026-08-18
作者发布了针对 RTX 3090 的 Qwen3.8-27B 超优化推理引擎更新。通过引入 fp16 recurrent state、全层 int8 activations、以及概率采样等优化手段,将单请求速度提升至 99 tps,批量请求峰值达到 1150 tps。Prefill 阶段速度也提升 25%-50%。项目代码已在 GitHub 开源。
「Infra」频道最新
- 摩根大通预测2026年AI加速器出货涨62%至1630万 — Beth_Kindig · 2026-08-18
- Ollama 测评:DeepSeek V4 Flash 性能最佳,Qwen 质优但慢 30 倍 — ollama · 2026-08-18
- 2026 智能体爆发推高前沿模型毛利率至 85% — ben_j_todd · 2026-08-18
- Bittensor 联创谈去中心化 AI:像挖比特币一样「挖智能」 — markjeffrey · 2026-08-18
- SGLang 比 vLLM 多占 18.5GB 显存:混合注意力模型实测存疑 — SomeRandomGuuuuuuy · 2026-08-18
- Qwen 27B F16 版本运行实测与显存需求 — Blues520 · 2026-08-18