给编码智能体加上自检修复循环,Terminal-Bench 得分提升 15 个百分点

Sorosu · reddit · 2026-08-19

Reddit 用户分享开源技能 Autoprompt:在编码智能体周围套上一层完整的「规划→实现→测试→审查→修复」自主循环,让 Agent 自动验证、审查并修复自己的产出。

在 Terminal-Bench 2.1 测试中,该工作流把 DeepSeek V4 Flash 的成绩从 67.42% 提升到 82.02%,说明模型外围工作流对最终质量影响巨大。作者提醒效果不保证在所有任务上复现,且额外循环会消耗更多时间、token 和费用,最适合困难或长时间运行的任务。

项目地址:github.com/Spielewoy/autoprompt-skill

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →