一个 200 行 ReAct 框架让开源模型竞速修复 3 个真实 bug
MaziyarPanahi · x · 2026-07-25
这条帖子展示了一个真实可跑的 多模型修 bug 工作流。
- 在一个真实仓库里放了 3 个隐藏 bug,用 pytest 作为裁判。
- 本地跑在一台 Mac Studio 上,模型包括 Bonsai-27B、Inkling、gemma-4-26B,通过 llama.cpp + MLX 部署。
- Kimi K3 则先通过 OpenRouter 调用,等权重周一公开后再本地跑。
- 整个 agent 循环大约是一个 200 行 的 ReAct harness,支持 read / edit / runtests,并且兼容任何 OpenAI-compatible 接口。
核心意思是:作者在用同一组真实 bug,做一套模型无关的编码 agent 对比实验。
所属事件:开源模型实战测试:200 行框架成功修复真实 bug(2 条相关)→
「编程与Agent」频道最新
- 双 RTX 3090 本地跑大模型,怎么选模型和推理栈 — ruffus_or · 2026-07-25
- ECC 为 Claude Code、Codex 和 Cursor 提供智能体优化外壳 — affaan-m · 2026-07-25
- Andrew Ng 的 aisuite 为多个生成式 AI 提供商提供统一接口 — andrewyng · 2026-07-25
- AFK Pilot 让 Grok Build 免隧道远程接管手机 — PawelHuryn · 2026-07-25
- Kimi K3 编程实测:API 太贵,订阅制是否够用? — agentcubed · 2026-07-25
- 4 个开源模型同修 3 个真实 bug,27B 速度快 14 倍 — MaziyarPanahi · 2026-07-25