三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95%
cephaloform · x · 2026-09-23
Ternary Bonsai 2 27B 发布:通过三元权重压缩,把 27B 模型的权重量压到 5.9GB(对比全精度 Qwen3 27B 的 54GB)。
作者用多个评测检验压缩后推理能力的保留程度,对照模型为全精度 Qwen3 27B(54GB)与 Gemma 4 12B QAT(约 7GB):
- 测试条件:无联网、无工具,仅用极简 harness 跑编程题;各模型用 llama.cpp 默认服务配置,Bonsai 与 Qwen 开超高推理强度
- 在训练截止后发布的 IMO 2026 题上,给每个模型 131k 思考上下文后强制输出答案
- 结果:Qwen 与 Bonsai 都落在人类铜牌区间上段(16-22 分),Bonsai 保留了基础模型约 95% 的表现
作者同时讨论了压缩后哪些能力保留、哪些仍有差距。
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23