给编码智能体加上自检修复循环,Terminal-Bench 得分提升 15 个百分点
Sorosu · reddit · 2026-08-19
Reddit 用户分享开源技能 Autoprompt:在编码智能体周围套上一层完整的「规划→实现→测试→审查→修复」自主循环,让 Agent 自动验证、审查并修复自己的产出。
在 Terminal-Bench 2.1 测试中,该工作流把 DeepSeek V4 Flash 的成绩从 67.42% 提升到 82.02%,说明模型外围工作流对最终质量影响巨大。作者提醒效果不保证在所有任务上复现,且额外循环会消耗更多时间、token 和费用,最适合困难或长时间运行的任务。
项目地址:github.com/Spielewoy/autoprompt-skill
「编程与Agent」频道最新
- Vercel 开源原生 AI 编程 Agent fx:10µs 冷启动 — Rasmic · 2026-08-19
- Grok 开源版文件上传服务 Byteship 发布 — jasonkneen · 2026-08-19
- ClawGym II 论文:混合跨工具训练 Agent — omarsar0 · 2026-08-19
- MacStories 发布 Codex 自动化指南:处理笔记、邮件与稍后读 — Dimillian · 2026-08-19
- 研究揭示上下文压缩致 Agent 调用增加三倍 — dair_ai · 2026-08-19
- Council of High Intelligence:多AI视角辩论辅助决策 — tom_doerr · 2026-08-19