HoH 论文详解:三大基准平均提升 52.25%,无人工开发出可玩 FPS
aigclink · x · 2026-09-05
Harness-of-Harness(HoH)论文页面公开(上海AI Lab,Haoyang Yan 等共同一作)。研究 LLM coding agent 的全自主软件开发:从高层需求到完整可用的软件,无进一步人工干预。
方法要点:
- 在现有 coding-agent harness 之上组织“规划-编码-测试”迭代循环
- 平衡修复与能力增长、把开发切分为小而可验证的增量、实现期测试与独立评估分离、只约束可验证产出
实验数据:在 GameCraft-Bench、FrontierSWE、ProgramBench 三个基准上,用 Codex+GPT-5.5(high)、OpenCode+DeepSeek-V4-Pro、Pi+MiniMax-M3 三组组合评测,HoH@1-3 三轮迭代后平均相对提升 52.25%,最高 82.86%。多日部署 70+ 轮迭代自主开发出 Fusepoint:带连贯剧情、完整核心机制、精致视觉与音频的可玩第一人称射击游戏。
项目页提供论文、GitHub 与游戏下载。
所属事件:上海AI Lab 发布 HoH,AI 自主开发出 FPS 游戏(2 条相关)→
「编程与Agent」频道最新
- Claude Code v2.1.251:effort 推理力度现可按模型分别保存 — EricBuess · 2026-09-05
- 开发者记录云端编码 agent 踩坑:六个关键失败点 — lucasmeijer · 2026-09-05
- 子代理用户研究实操:记录卡点、Docker 装不上的位置 — lucasmeijer · 2026-09-05
- 开发者用子代理实测自家编程 Agent 的安装流程 — lucasmeijer · 2026-09-05
- PyTorch 核心开发者发现:ChatGPT 安卓端不显示 Codex 入口 — ezyang · 2026-09-05
- 写操作 MCP server 踩坑复盘:9 条生产环境实战经验 — Ecstatic-Hurry-635 · 2026-09-05