专题 · FULL STORY
Bonsai 2三值量化:从爆火发布到实测翻车
9月18日PrismML发布三值量化模型Bonsai 2,将27B模型压至约6GB并宣称保留98.2%性能,迅速登上Hugging Face趋势榜。十天后有用户实测长任务表现大幅下滑,官方宣传与实际体验出现明显落差,引发社区对三值量化可行性的讨论。
2026-09-18 ~ 2026-09-28 · 2 集 · 22 条
第 1 集 · Bonsai 2 27B三值量化发布,5.9GB保留98.2%性能(2026-09-18,20 条)
9月18日,PrismML在Hugging Face发布三值量化推理模型Ternary Bonsai 2(27B),发布后迅速登上趋势榜/热门模型榜,次日上线OpenRouter。该模型基于Qwen3.8-27B的混合注意力架构,架构未改动、仅做三元量化,权重压缩为-1/0/+1三元值并配FP16分组缩放,等效每权重约1.76 bit,体积仅5.9GB(模型卡口径5.95GB;FP16原版54GB,约缩小9倍),官方称保留98.2%的聚合基准性能,可在消费级硬件甚至WebGPU浏览器中直接运行。当前结论:这是一次以极小质量代价换取约9倍压缩的开源尝试,若性能数据得到独立验证,可能改变大模型的分发与使用方式。
已确认
- 基于Qwen3.8-27B的混合注意力架构(量化配置为prismhadamardqwen35),架构未改动,仅做三元量化,采用{-1, 0, +1}三值权重加FP16分组缩放,等效每权重约1.76 bit
- 权重体积5.9GB(模型卡口径5.95GB),约为FP16原版54GB的1/9;显存占用约5.9GB
- 官方聚合基准测试称达到Qwen3.8 27B FP16成绩的98.2%
- 提供多种量化格式:GGUF(可直接在llama.cpp中运行)、MLX 2-bit量化版、ONNX等,另有PTQ10量化口径(约1.75 bits/权重)的社区转述
- 已在M5 Max上实测;多位转发者提到3080亦可运行(12GB显存即可),支持WebGPU浏览器内推理;@gajesh称可跑手机;@MaziyarPanahi分享在Mac本地约5.7秒读懂用药单变化的体验
- 社区有用户演示CUDA补丁后再提速32%(@airesearch12转述)
- 以Apache 2.0协议开源,主打agentic场景,Bonsai-2系列合集已上架Hugging Face并登上趋势榜
- 9月19日@gajesh报告该模型已上线OpenRouter:支持编码、数学、工具调用与图像理解,上下文窗口262K,默认开启思考模式(OpenRouter侧权重约8.5GB)
- 距第一代Bonsai 27B发布仅两个月,显存占用不变,最大改进在于量化后的质量表现
尚未确认
- 98.2%性能保留率为厂商口径。@airesearch12与@MaziyarPanahi均明确提示该数据未经独立验证,尚需第三方评测确认
为什么重要
三值量化可将权重压缩为-1/0/+1,大幅降低显存占用与推理成本。多位转发者指出,6GB级体积让27B参数模型可以在消费级设备甚至手机、浏览器中运行;社区还出现了CUDA补丁提速32%的实践,说明端侧生态在快速跟进。若质量损失可控(本代98.2%的保留率是关键卖点),可能改变大模型的分发与使用方式。次日即上架OpenRouter也表明其从开源权重到托管服务的落地速度很快。
- Ternary Bonsai 2 27B 发布:体积缩至 1/9,仍保留 98.2% 基准性能 — cephaloform · 2026-09-18
- Ternary Bonsai 2 27B 发布:三元量化后仅 5.9GB,保留 98.2% 性能 — cephaloform · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18
- Ternary Bonsai 2 上架 Hugging Face:27B 三值权重推理模型仅 6GB — cephaloform · 2026-09-18
- Bonsai 2 27B 开源:三值权重仅 5.95GB,跑分达 FP16 版 98.2% — airesearch12 · 2026-09-18
- 27B 三值模型 Ternary-Bonsai-2 登 HF 趋势,主打 2-bit 端侧推理 — prism-ml · 2026-09-18
- Ternary Bonsai 2 27B 发布:9 倍压缩仍保留 98.2% 性能 — TheZachMueller · 2026-09-18
- Ternary Bonsai 2 27B 发布:仅5.9GB保留98.2%性能,3080可跑 — cephaloform · 2026-09-18
- 三值化 Bonsai 2 27B 开源:5.9GB 跑手机,保留 98.2% 基准性能 — gajesh · 2026-09-18
- PrismML 发布三值化 Bonsai 2 27B:仅 5.9GB 保留 98.2% 性能 — pcuenq · 2026-09-18
- 三值 2-bit 量化模型 Ternary-Bonsai-2-27B 登 HF 热榜 — prism-ml · 2026-09-18
- PrismML 发布 Bonsai 2 27B:三元权重压缩 9 倍至 5.9GB,保留 98.2% 性能 — airesearch12 · 2026-09-18
- Bonsai 2 27B 三值压缩至 5.9GB,体积缩小 9 倍保留 98.2% 性能 — MaziyarPanahi · 2026-09-18
- Bonsai-2 27B 三值模型在 Mac 本地 5.7 秒读懂用药单变化 — MaziyarPanahi · 2026-09-18
- Ternary Bonsai 2 27B 发布:仅 5.9GB 达全精度模型 98.2% 性能 — ivan_bezdomny · 2026-09-18
- 三值量化 Bonsai 2 27B 发布:体积缩小 9 倍仍保留 98.2% 性能 — alexcovo_eth · 2026-09-19
- PrismML 发布 Bonsai 2 27B:体积缩小 9 倍仅 5.9GB,保留 98.2% 性能 — alexcovo_eth · 2026-09-19
- PrismML 发布 Bonsai 2 27B:比 Qwen3.8 小 9 倍,性能保留 98.2% — ivan_bezdomny · 2026-09-19
- PrismML 三值压缩 Bonsai 2 27B 上线 OpenRouter,权重仅约 8.5GB — gajesh · 2026-09-19
- 1.58bit 三进制 27B 模型跑进 12GB 显卡,CUDA 补丁再提速 32% — airesearch12 · 2026-09-19
第 2 集 · Bonsai 2三值压缩将27B模型压至6GB实测长任务翻车(2026-09-28,2 条)
PrismML 的 Bonsai 2 通过将所有权重重训练为 −1/0/+1 三值,把 Qwen3.8 27B 压缩进单个 6GB 文件,官方宣称保留全量模型 98% 性能。YouTube 频道 Prompt Engineering 实测发现,短任务上表现确实接近原模型,但在需要长上下文与持续追踪的 Agent 任务中性能显著崩塌,压缩模型在复杂长程场景下仍不可靠。
- Bonsai 2 把 Qwen 压到 6GB 仍存 98% 性能,长 Agent 任务却翻车 — Prompt Engineering · 2026-09-28
- 实测 Bonsai 2:6GB 跑 27B 模型,短任务打平长任务全崩 — Prompt Engineering · 2026-09-28