Bonsai 2 27B 量化版实测:7GB 内存跑出远超同级 3D 生成质量
Fun-Meaning-6474 · reddit · 2026-09-19
Reddit 用户在单卡 RTX 5090 上对比了 PrismML 新发布的重度量化模型 Bonsai 2 27B(PQ20,7.2GB)与同内存段的 Gemma 4 12B(Q80)、Qwen 3.5 9B(Q6K),三者在 262K 上下文下用同一个约 770 词的 three.js 体素日式宝塔单文件 HTML 提示词各跑一次。
结果:
- Bonsai 2 27B:输出 106,396 tokens,约 17.5 分钟,约 101 tok/s,约 90% 的 token 花在思考上,场景细节明显最好
- Gemma 4 12B:9,159 tokens,约 95 秒,约 96 tok/s,画面尚可但偏灰白
- Qwen 3.5 9B:12,105 tokens,约 70 秒,约 168 tok/s,输出基本崩坏
作者结论:在 7-8GB 这个内存段,Bonsai 2 提供了无与伦比的智能水平,3060 级显卡即可流畅运行并完成像样的工作,是本地 AI 社区的一次大胜。注意 Bonsai 的 GGUF 需用 PrismML 的 llama.cpp fork 加载,原版 llama.cpp 不支持。作者自述是 atomic.chat 联合创始人(与 PrismML 有合作关系)。
「Infra」频道最新
- HEIF Heist:一个 C 图像解析器漏洞撬动 OpenAI、Meta、GitHub 等全线 RCE — ccerrato147 · 2026-09-19
- Turbo-dLLM 开源:新并行策略让长上下文扩散 LLM 训练提速至 7.59 倍 — Azaliamirh · 2026-09-19
- Luminal 用 AMD MI300X 跑 FLUX.2,靠便宜算力压低单图成本 — ycombinator · 2026-09-19
- 弗州州长设 AI 工作组并收紧数据中心审批 — The Verge AI · 2026-09-19
- Google Cloud Spanner 新增原生队列:数据库内实现事务性异步消息 — rseroter · 2026-09-19
- AI Infra 峰会访谈:Penguin 与 Astera Labs 押注 CXL 内存扩展方案 — BenBajarin · 2026-09-19