生产级代码修复 agent 选型:单次跑 2 小时、预算 30-50 美元
SmallDepartment8463 · reddit · 2026-09-07
楼主在做一个真实生产系统的自主代码修复 agent:Python monorepo 从杂乱 PDF(OCR、银行流水、税单)抽取财务数据,任务失败时 agent 被唤醒,拿到失败证据、沙箱仓库和 shell/文件工具,最多 60 轮工具调用进行调查、提假设、改代码,只有通过确定性裁判(失败任务必须复跑成功、固定回归语料分毫不差、diff 上限约 40 行删除)才允许合入。
- 单次运行约 2 小时,预算 30-50 美元,延迟不敏感
- 诚实承认「修不了」优于幻觉补丁,坏修复最终升级给人类
- 目前跑 Anthropic 旗舰模型,成功率高但仍有难例升级
- 楼主向跑过长程 agentic 会话(50+ 工具轮、100K+ token 上下文)的人取经:哪家模型在这个尺度上不跑偏?有没有人用真实失败任务而非 SWE-bench 做过对垒?哪家更擅长「知道何时放弃」?
- 他可以配置切换模型复跑真实失败任务,承诺按讨论结果做 bake-off 并汇报。
「编程与Agent」频道最新
- context-mode 把 agent 工具输出缩减 98%,星标超 2 万 — mksglu · 2026-09-07
- 微软开源文档转 Markdown 工具 markitdown 星标突破 17.9 万 — microsoft · 2026-09-07
- HeyGen 开源 hyperframes:用 HTML 给 agent 渲染视频,星标 4.4 万 — heygen-com · 2026-09-07
- 面向 AI agent 的隐身无头浏览器 camofox 星标破 9300 — jo-inc · 2026-09-07
- Zig 编写的 AI 专用无头浏览器 Lightpanda 星标达 3.4 万 — lightpanda-io · 2026-09-07
- AI 智能体成了数据库访客,EDB 工程师分享可观测性实践 — marlene_zw · 2026-09-07