Qwen3.8-27B 多卡实测:3090极致优化672 tps

Qwen3.8-27B 模型发布后,社区针对不同显卡进行了密集的本地性能实测。RTX 3090 通过极致量化优化达到 672 tps,RTX 5090 与 RTX 6000 Pro 配合 SGLang 技术分别跑出 206 tok/s 与 223 tok/s 的高吞吐。在消费级主流显卡上,如 RTX 4090 和 4080 Super,模型在长上下文编码及日常生成任务中均表现出可用性。

已确认

尚未确认

为什么重要

2026-08-16 ~ 2026-08-17 · 6 条相关

一手来源