3x 3090 本地跑 Qwen 3.8 Next Flash:3 比特量化体验堪比 Q8
nicholas_the_furious · reddit · 2026-09-20
一位本地 LLM 玩家在 3x RTX 3090(250-265W,其中一块为 TB4 eGPU)上实测 Qwen 3.8 系列模型,给出具体配置结论:
- 日常主力:Qwen 3.8 27B UD-Q8KL,2x 3090 张量并行,全 FP16 KV Cache 可跑到 250k+ 上下文无明显退化(上一代 3.6 版约 150k 就需压缩会话),作编码 agent 表现优秀。
- 试玩更大模型:Qwen 3.8 Flash Next 的 UD-Q4KXL 质量惊艳——用固定的“让模型写 Flappy Bird”测试,产出带完整 UI、动画、升降管道等独特机制的作品,远超 27B 的世界知识,但部分层 offload 到内存导致 PP 仅数百 t/s、输出约 35-50 t/s,不可用。
- 最终方案:改用 EXL3 3.05bpw 量化,整个模型装进 3 卡显存、全上下文 + FP16 KV Cache(仅 engram 表 offload),体感与 Q8 无差别,跑出 110+ t/s 输出、1500+ t/s prefill。
作者结论:如果你有 3x 3090,直接上 Qwen 3.8 Next Flash 的 exl3 3.05bpw;EXL3 对 27B 不划算, Unsloth Q3 量化也值得一试。
「Infra」频道最新
- 传 Anthropic 训练算力强度与推理经济性落后于 OpenAI — teortaxesTex · 2026-09-20
- 6 张 V100 跑通 Qwen 3.8 Next:MTP 提速近一倍至 43 tok/s — Odd_Caterpillar_2994 · 2026-09-20
- Ben Bajarin:Agent 工作流将催生「Agentic 原生 CPU」新层级 — BenBajarin · 2026-09-20
- Reddit 用户怒批 FP4 推理热潮:小模型 4bit 直接废掉 — buttplugs4life4me · 2026-09-20
- 材料技术放缓芯片贬值,Beff:以为到了终局,坏消息在后面 — beffjezos · 2026-09-20
- Reddit 热议:AI Agent 运行时能不能搬到 Cloudflare Workers 等 Edge? — merlinofthewater · 2026-09-20