RTX 3090 跑 Qwen 3.8 27B 约 35 t/s

cviperr33 · reddit · 2026-08-15

用户报告在 RTX 3090 上使用 llama.cpp 运行 Qwen 3.8 27B(IQ4 NL 量化),速度约为 34-36 tokens/s。相比此前 3.6 版本的 50-60 t/s 有所下降,但尚未开启推测解码。尽管速度变慢,用户认为模型体验属于次世代级别。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →