RTX 3090 实测 Qwen3.8-Flash:量化策略与性能调优
crusaderky · reddit · 2026-08-28
作者分享了在 RTX 3090 (12GB VRAM) 上部署 Qwen3.8-Flash-next 的详细经验。通过使用 IQ4XS 权重、kvarn5 KV cache 等配置,在特定设置下实现了 160 tok/s prefill 和 16 tok/s decode。文章还提供了不同显存容量(16GB/12GB)下的变种配置建议及 llama.cpp 的部署链接。
所属事件:用户实测 Qwen3.8 Flash Next 消费级显卡本地部署(2 条相关)→
「Infra」频道最新
- 云反思:企业盲目上云后的理性回归 — DavidLinthicum · 2026-08-29
- OpenAI Python SDK 弃用 httpx,迁移至 HTTPX2 — mitsuhiko · 2026-08-29
- a16z 推出 11 亿美元 Machine Age 基金,聚焦 AI 基建与硬件 — Polymarket · 2026-08-29
- 本地动漫图像编辑最佳配置:WebUI与模型选择指南 — Mystvearn_ · 2026-08-29
- x401 协议草案:基于 HTTP 的凭证证明要求 — csuwildcat · 2026-08-29
- GLM 5.3 开源权重亮相,DFlash 2 投机解码吞吐达 FP8 的 4.4 倍 — gan_chuang · 2026-08-29