1bit量化让Qwen 27B在12GB显存跑出92 tokens/s
zyxciss · reddit · 2026-08-16
Reddit 用户 zyxciss 尝试了 Qwen3.8-27B 的 1bit 量化版本(来自 HuggingFace 的 AtomicChat/Qwen3.8-27B-GGUF),成功在 RTX 3060 12GB 上运行。启用 MTP 后,速度达到约 92 tokens/s。
尽管量化后模型质量严重下降(目前不可用),但能在 3060 上跑出这个速度仍令人惊讶。用户原本期待 35B MoE 版本,但似乎不会出现。
「Infra」频道最新
- 高性能计算新书:《现代硬件算法》开源编写中 — thehiphopswami · 2026-08-16
- Q8_0 与 UD-Q6_K_XL 量化质量差异有多大 — AnimalPuzzleheaded71 · 2026-08-16
- Gavin Baker:英伟达正成为 AI 界的中央银行 — VibeMarketer_ · 2026-08-16
- 万亿参数LLM的本质:数十亿MOSFET开关在3GHz翻转 — blaizedsouza · 2026-08-16
- AI下一个瓶颈是电力,算力并非唯一制约 — ingliguori · 2026-08-16
- 谷歌HEIR编译器开源,实现不解密AI推理 — heypearlai · 2026-08-16