Qwen3.8-27B 推理优化:RTX 3090 跑出 1150 tps

iamMess · reddit · 2026-08-18

作者发布了针对 RTX 3090 的 Qwen3.8-27B 超优化推理引擎更新。通过引入 fp16 recurrent state、全层 int8 activations、以及概率采样等优化手段,将单请求速度提升至 99 tps,批量请求峰值达到 1150 tps。Prefill 阶段速度也提升 25%-50%。项目代码已在 GitHub 开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →