专题 · FULL STORY

Bonsai 2三值量化:从爆火发布到实测翻车

9月18日PrismML发布三值量化模型Bonsai 2,将27B模型压至约6GB并宣称保留98.2%性能,迅速登上Hugging Face趋势榜。十天后有用户实测长任务表现大幅下滑,官方宣传与实际体验出现明显落差,引发社区对三值量化可行性的讨论。

2026-09-18 ~ 2026-09-28 · 2 集 · 22 条

第 1 集 · Bonsai 2 27B三值量化发布,5.9GB保留98.2%性能(2026-09-18,20 条)

9月18日,PrismML在Hugging Face发布三值量化推理模型Ternary Bonsai 2(27B),发布后迅速登上趋势榜/热门模型榜,次日上线OpenRouter。该模型基于Qwen3.8-27B的混合注意力架构,架构未改动、仅做三元量化,权重压缩为-1/0/+1三元值并配FP16分组缩放,等效每权重约1.76 bit,体积仅5.9GB(模型卡口径5.95GB;FP16原版54GB,约缩小9倍),官方称保留98.2%的聚合基准性能,可在消费级硬件甚至WebGPU浏览器中直接运行。当前结论:这是一次以极小质量代价换取约9倍压缩的开源尝试,若性能数据得到独立验证,可能改变大模型的分发与使用方式。

已确认

  • 基于Qwen3.8-27B的混合注意力架构(量化配置为prismhadamardqwen35),架构未改动,仅做三元量化,采用{-1, 0, +1}三值权重加FP16分组缩放,等效每权重约1.76 bit
  • 权重体积5.9GB(模型卡口径5.95GB),约为FP16原版54GB的1/9;显存占用约5.9GB
  • 官方聚合基准测试称达到Qwen3.8 27B FP16成绩的98.2%
  • 提供多种量化格式:GGUF(可直接在llama.cpp中运行)、MLX 2-bit量化版、ONNX等,另有PTQ10量化口径(约1.75 bits/权重)的社区转述
  • 已在M5 Max上实测;多位转发者提到3080亦可运行(12GB显存即可),支持WebGPU浏览器内推理;@gajesh称可跑手机;@MaziyarPanahi分享在Mac本地约5.7秒读懂用药单变化的体验
  • 社区有用户演示CUDA补丁后再提速32%(@airesearch12转述)
  • 以Apache 2.0协议开源,主打agentic场景,Bonsai-2系列合集已上架Hugging Face并登上趋势榜
  • 9月19日@gajesh报告该模型已上线OpenRouter:支持编码、数学、工具调用与图像理解,上下文窗口262K,默认开启思考模式(OpenRouter侧权重约8.5GB)
  • 距第一代Bonsai 27B发布仅两个月,显存占用不变,最大改进在于量化后的质量表现

尚未确认

  • 98.2%性能保留率为厂商口径。@airesearch12与@MaziyarPanahi均明确提示该数据未经独立验证,尚需第三方评测确认

为什么重要

三值量化可将权重压缩为-1/0/+1,大幅降低显存占用与推理成本。多位转发者指出,6GB级体积让27B参数模型可以在消费级设备甚至手机、浏览器中运行;社区还出现了CUDA补丁提速32%的实践,说明端侧生态在快速跟进。若质量损失可控(本代98.2%的保留率是关键卖点),可能改变大模型的分发与使用方式。次日即上架OpenRouter也表明其从开源权重到托管服务的落地速度很快。

第 2 集 · Bonsai 2三值压缩将27B模型压至6GB实测长任务翻车(2026-09-28,2 条)

PrismML 的 Bonsai 2 通过将所有权重重训练为 −1/0/+1 三值,把 Qwen3.8 27B 压缩进单个 6GB 文件,官方宣称保留全量模型 98% 性能。YouTube 频道 Prompt Engineering 实测发现,短任务上表现确实接近原模型,但在需要长上下文与持续追踪的 Agent 任务中性能显著崩塌,压缩模型在复杂长程场景下仍不可靠。