2-bit Bonsai-27B 能塞进 8GB 显存,但输给了 Qwen3.5-9B

Creative-Regular6799 · reddit · 2026-07-21

一位 Reddit 用户在一台 RTX 5070 Laptop 8GB 上,用 agent harness 跑了 Terminal-Bench 2.0,对比了 Ternary-Bonsai-27B(2-bit) 和 Bonsai-27B(1-bit),并拿它们和同一套基准里的 Qwen 模型做了横向比较。

实测设置

结果

作者的结论很直接:2-bit 确实能完整塞进 GPU,工具调用也很干净,但准确率甚至不如同卡能跑的更小密集模型。1-bit 模型在简单提示词上还能用,但放进 agent loop 后会出现 14,000+ token 的 runaway completion,始终不吐 stop token,最后把上下文耗尽。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →