Harness-of-Harness 跨轮传递状态,长程编码 Agent 得分 71.5 vs 58.2
rohanpaul_ai · x · 2026-09-06
HoH(Harness-of-Harness)方法解决长周期编码 agent 的核心痛点:项目越长,agent 越容易遗忘早期决策、重复劳动、破坏已工作功能、漏掉未完成需求。
- 做法:把当前软件、测试证据、已知问题和更新后的计划一并「携带」进下一轮编码运行,配合独立测试和基于真实失败的重新规划。
- 结果:3 种 agent 配置在 3 个软件基准上全部提升。最直观的对比:Codex + GPT-5.5 在 GameCraft-Bench 上跑 3 轮,HoH 得分 71.52,简单延续同一 agent 只有 58.24。
- 极限测试:连跑 70 轮,从高层需求直接产出可玩的 FPS 游戏——但仅限单个游戏项目且用了额外工具,泛化性仍待验证。
- 结论:长程编码的关键不是给 agent 更多时间,而是持久项目状态 + 独立 QA + 证据驱动的重规划。
所属事件:上海AI Lab 发布 HoH 框架,长程编码 Agent 三基准提升超五成(4 条相关)→
「编程与Agent」频道最新
- 让 Agent 接管 Twitter 线程收尾,它还顺手清理了多余空格 — andimarafioti · 2026-09-06
- Astra 剪视频细节:自动切掉废镜头和切窗口等冗余片段 — adonis_singh · 2026-09-06
- Astra 不止会玩 Redstone,还能自己剪视频 — adonis_singh · 2026-09-06
- Agent 工作流也该跑分:前沿模型与便宜模型如何取舍 — zainhas · 2026-09-06
- 3 天修复 136 个 bug 并新增 4 家公司接入,开发者晒迭代速度 — cneuralnetwork · 2026-09-06
- 开发者让 AI agent 通宵自主开发,一觉醒来 bug 已修复 — TianbaoX · 2026-09-06