2-bit Bonsai-27B 能塞进 8GB 显存,但输给了 Qwen3.5-9B
Creative-Regular6799 · reddit · 2026-07-21
一位 Reddit 用户在一台 RTX 5070 Laptop 8GB 上,用 agent harness 跑了 Terminal-Bench 2.0,对比了 Ternary-Bonsai-27B(2-bit) 和 Bonsai-27B(1-bit),并拿它们和同一套基准里的 Qwen 模型做了横向比较。
实测设置
- 共 89 个任务
- 单次尝试(k=1),40-turn cap,temp=0.2
- 运行时是 PrismML 的 llama.cpp fork,因为原版 llama.cpp 不能加载 2-bit kernels
结果
- Ternary-Bonsai-27B(2-bit):7.9%
- Qwen3.5-9B:9.2%
- Qwen3.6-35B-A3B:24.3%
- Bonsai-27B(1-bit):在 agent 环境里不可用
作者的结论很直接:2-bit 确实能完整塞进 GPU,工具调用也很干净,但准确率甚至不如同卡能跑的更小密集模型。1-bit 模型在简单提示词上还能用,但放进 agent loop 后会出现 14,000+ token 的 runaway completion,始终不吐 stop token,最后把上下文耗尽。
「编程与Agent」频道最新
- 构建 AI Agent 安全网关:如何自托管多 SaaS 的 OAuth 集成 — Defiant_Cod_2654 · 2026-07-22
- Rowboat 作为开源本地优先 AI 同事上线 — ycombinator · 2026-07-22
- Scoble 说 AI 的 loops 本质是长运行多智能体工作区 — Scobleizer · 2026-07-22
- Kimi Code 开放候补名单,Moonshot 推进编码产品 — Fabulous_Bonus_8981 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- 独立开发者探讨:当前 AI Agent 记忆层的真正痛点在哪? — AcceptableTime7937 · 2026-07-22