1bit量化让Qwen 27B在12GB显存跑出92 tokens/s

zyxciss · reddit · 2026-08-16

Reddit 用户 zyxciss 尝试了 Qwen3.8-27B 的 1bit 量化版本(来自 HuggingFace 的 AtomicChat/Qwen3.8-27B-GGUF),成功在 RTX 3060 12GB 上运行。启用 MTP 后,速度达到约 92 tokens/s。

尽管量化后模型质量严重下降(目前不可用),但能在 3060 上跑出这个速度仍令人惊讶。用户原本期待 35B MoE 版本,但似乎不会出现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →