开源模型实战测试:200 行框架成功修复真实 bug
开发者展示了一个基于 200 行代码的 ReAct 框架多模型修 Bug 工作流。该测试在真实代码仓库中隐藏了 3 个 Bug 并以 pytest 作为裁判。结果显示,Bonsai-27B、Gemma-4 和 Inkling 等 4 个开源模型均在本地成功修复了所有缺陷。其中,Bonsai-27B 在执行速度上表现出色,比其他模型快 14 倍。
2026-07-25 ~ 2026-07-25 · 2 条相关
- 4 个开源模型同修 3 个真实 bug,27B 速度快 14 倍 — MaziyarPanahi · 2026-07-25
- 一个 200 行 ReAct 框架让开源模型竞速修复 3 个真实 bug — MaziyarPanahi · 2026-07-25