RTX 4090 跑 Qwen3 27B 达 90 t/s,附完整 llama.cpp 配置

SirApprehensive7573 · reddit · 2026-08-21

用户分享在 RTX 4090(24GB 显存全空闲)上用 llama.cpp 跑 Qwen3-27B UD-IQ4XS 量化版的具体配置:全 GPU 层、FlashAttention、KV cache 用 q80、batch 256/ubatch 64,并用 MTP-2 投机解码,在 242k 上下文下达到约 90 t/s。不启用 MTP 时可跑满 262k 上下文但速度降到 45-50 t/s;作者在大型代码库上配合 opencode 使用,更看重速度而非多出的 20k 上下文。他还对比了其他 Q4 量化与 FP16 KV cache,均未察觉差别。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →