RTX 3090 实测 Qwen3.8-Flash:量化策略与性能调优

crusaderky · reddit · 2026-08-28

作者分享了在 RTX 3090 (12GB VRAM) 上部署 Qwen3.8-Flash-next 的详细经验。通过使用 IQ4XS 权重、kvarn5 KV cache 等配置,在特定设置下实现了 160 tok/s prefill 和 16 tok/s decode。文章还提供了不同显存容量(16GB/12GB)下的变种配置建议及 llama.cpp 的部署链接。

所属事件:用户实测 Qwen3.8 Flash Next 消费级显卡本地部署(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →