Harness-of-Harness 框架让编码 Agent 多天自主开发,平均提升 52%
rohanpaul_ai · x · 2026-09-06
arXiv 论文《Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement》提出 HoH 框架,让基于 LLM 的编码 Agent 在无人工干预下持续改进软件。
- HoH 运行在现有编码 Agent harness 之上,把执行组织为迭代的「规划-编码-测试」循环
- 关键设计:修复与能力增长平衡、拆小可验证增量、实现期测试与独立评估分离、维护版本化项目历史、鼓励复用而非重写
- 在 GameCraft-Bench、FrontierSWE、ProgramBench 上,三组 harness-模型配对(Codex+GPT-5.5、OpenCode+DeepSeek-V4-Pro、Pi+MiniMax-M3)均跑赢单独 harness,三轮迭代后平均相对增益 52.25%,最高 82.86%
- 一次超过 70 轮迭代的多天部署中,HoH 自主开发出一个第一人称游戏类完整软件
核心论点:长周期自主开发不只靠给 Agent 更多时间,而需要持久项目状态、独立测试与基于真实失败的重新规划。
所属事件:上海AI Lab 发布 HoH 框架,长程编码 Agent 三基准提升超五成(4 条相关)→
「编程与Agent」频道最新
- 让 Agent 接管 Twitter 线程收尾,它还顺手清理了多余空格 — andimarafioti · 2026-09-06
- Astra 剪视频细节:自动切掉废镜头和切窗口等冗余片段 — adonis_singh · 2026-09-06
- Astra 不止会玩 Redstone,还能自己剪视频 — adonis_singh · 2026-09-06
- Agent 工作流也该跑分:前沿模型与便宜模型如何取舍 — zainhas · 2026-09-06
- 3 天修复 136 个 bug 并新增 4 家公司接入,开发者晒迭代速度 — cneuralnetwork · 2026-09-06
- 开发者让 AI agent 通宵自主开发,一觉醒来 bug 已修复 — TianbaoX · 2026-09-06