RTX 3090 跑 Qwen3.8-27B 推理达 134 TPS,长文响应秒回

iamMess · reddit · 2026-08-20

作者将 Qwen3.8-27B 在 RTX 3090 上的推理速度推至 134 TPS(默认采样),并大幅降低长对话多轮响应延迟(从 23 秒降至约 1 秒)。

核心优化:

性能数据:

所属事件:RTX 3090 上 Qwen3.8-27B 推理提速至 381 TPS(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →