实测 Bonsai 2:6GB 跑 27B 模型,短任务打平长任务全崩
Prompt Engineering · youtube · 2026-09-28
YouTube 频道 Prompt Engineering 实测 PrismML 的 Bonsai 2,该三进制压缩方案宣称以 6GB 文件保留 Qwen 27B 模型 98% 的性能。
实测结论:
- 同一 agent 测试框架、关闭思考模式下,短任务基本打平(48.6 vs 47.1)
- 但在 6 个长 agentic 构建任务中,完整版 Qwen 得 35/60,Bonsai 2 没有一个可运行的应用,甚至出现同一搜索重复执行 114 次
- 视频讲解三进制压缩原理、其白皮书对 agentic benchmark 的表述,以及如何在 trace 中识别压缩模型的失败征兆
对想在本地小显存跑大模型的用户:压缩模型跑聊天尚可,交给 agent 长任务需谨慎。
所属事件:Bonsai 2三值压缩将27B模型压至6GB实测长任务翻车(2 条相关)→
「模型」频道最新
- 用户实测:GPT 最高推理档理论证明仍藏 bug — MvsCerezo · 2026-09-29
- 让 Opus 5.5 自己解释动画是怎么做的:它生成 2 分钟第一性原理讲解视频 — jnack · 2026-09-29
- Gemini 3.5 Pro 被砍:吐槽称正确做法是宣称「太危险不宜发布」 — signulll · 2026-09-29
- 实测:$200 Claude Code 订阅每月可白嫖约 9000 美元 Opus 用量 — RexDouglass · 2026-09-29
- Bindu Reddy 实测:「Sonnet 5.5」各档位都不行,不如 Sol 5.6 — bindureddy · 2026-09-29
- 同提示四模型横评:Claude Sonnet 明显胜过 OpenAI 两款模型 — sven_ai · 2026-09-29