Bonsai 2 27B 安全护栏砍掉近 20 分,SWE-bench 与 Terminal-bench 成绩大缩水
julianharris · x · 2026-09-20
有用户深挖评测报告发现,Bonsai 2 27B 在 Terminal-bench 与 SWE-bench 上的成绩在开启安全护栏后下降近 20 个百分点,称这是主基准表中本应公开却缺失的关键数据。评论者直呼这是「严重的脑叶切除手术」,质疑厂商在主基准表里只报未加护栏的成绩、掩盖安全措施带来的能力代价。
「编程与Agent」频道最新
- 决策模型 Jev 免费上线 Venice API:只回类型化答案不写散文 — 0xAllen_ · 2026-09-20
- 家长用 Claude skill 自动抓历史课延伸读物并预约图书馆取书 — nwilliams030 · 2026-09-20
- 用单个 Rust megakernel 在终端里渲染整个 Google 地图 — bilawalsidhu · 2026-09-20
- 博主晒编码模型+工具栈:Kimi K3 最佳开源,Claude Code 翻倍烧钱 — Yuchenj_UW · 2026-09-20
- 用 Jev 做实体消解:成本降 99.56%,吞吐升 7.35 倍,附 prompt 与踩坑 — hrishioa · 2026-09-20
- 9.9k 星开源项目:纯 PyTorch 从零训练并对齐你自己的 LLM — tom_doerr · 2026-09-20