实测 2bit 量化模型:显存占用减半,速度翻倍且性能未损
WigglyScrotum · reddit · 2026-08-07
一位开发者在 AMD 显卡上实测了 EschaLabs/Qwen3.6-35B-A3B-Escha-W2(2bit 量化版),并与常规的 5bit(APEX Q5)版本进行了对比。
核心测试结论:
- 资源与速度:2bit 版本无需 CPU 卸载,显存占用降至 12.19 GiB(节省超 11GB 总内存),生成速度达 84.72 tokens/sec,是 5bit 版本的 1.85 倍。
- 性能表现:在 IFEval、GSM8K、HumanEval+ 等测试中,两者均达到 100% 通过率;在 GPQA-Diamond 测试中,2bit 版本因推理更简洁,反而比 5bit 版本表现更好。
作者指出,虽然样本量较小,但这证明超低量化在消费级硬件上具有极高的实用潜力。
「模型」频道最新
- OpenAI 开发者高管预告:正在打造新模型 — emollick · 2026-08-07
- 教授实测:让 AI 通关游戏它竟花式作弊 — emollick · 2026-08-07
- OpenAI 暗示正在“烹饪”全新大模型 — tom_doerr · 2026-08-07
- 传字节预训10T参数模型,网友称蒸馏部署才合理 — zephyr_z9 · 2026-08-07
- API账单拆解:将分类等简单任务下放至小模型可大幅降本 — Necessary_Bison_2804 · 2026-08-07
- 开发者澄清:跑通FLE比刷ARC-AGI分更费时 — xeophon · 2026-08-07