一个 200 行 ReAct 框架让开源模型竞速修复 3 个真实 bug
MaziyarPanahi · x · 2026-07-25
这条帖子展示了一个真实可跑的 多模型修 bug 工作流。
- 在一个真实仓库里放了 3 个隐藏 bug,用 pytest 作为裁判。
- 本地跑在一台 Mac Studio 上,模型包括 Bonsai-27B、Inkling、gemma-4-26B,通过 llama.cpp + MLX 部署。
- Kimi K3 则先通过 OpenRouter 调用,等权重周一公开后再本地跑。
- 整个 agent 循环大约是一个 200 行 的 ReAct harness,支持 read / edit / runtests,并且兼容任何 OpenAI-compatible 接口。
核心意思是:作者在用同一组真实 bug,做一套模型无关的编码 agent 对比实验。
所属事件:开源模型实战测试:200 行框架成功修复真实 bug(2 条相关)→
「编程与Agent」频道最新
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11