清华 AAArena 论文:AI agent 靠复盘登顶游戏榜,复杂规则仍卡关
rohanpaul_ai · x · 2026-10-11
清华团队基于其年度 bot 竞赛的 12 款游戏构建了 AAArena 评测环境,收录 1,920 个历史人类程序作为对手,考察权重固定的 coding agent 能否通过读规则、挑对手、研究对局复盘来迭代改写自己的 bot。
核心发现:
- 详细复盘远胜胜负反馈:在全部 3 款测试游戏中,使用 replay 反馈的 agent 表现全面优于只看输赢;Pacman bot 借助复盘冲到第 1 名,无复盘仅列第 11。
- 算力堆不动:把对局预算提高 3 倍,4 个陷入停滞的 bot 仍无一登顶。
- 结论:从有限对局中学习制胜策略依然困难,面对会变化的对手尤其如此。
论文: arxiv.org/abs/2610.12341
「研究」频道最新
- Epoch AI 与 Anthropic 研究一致:AI Agent 距自主科研仍很远 — The Decoder · 2026-10-11
- 自动研究 Agent 会陷入「点子盆地」,fork-and-flush 提出破局法 — menhguin · 2026-10-11
- 权重绑定的循环 Transformer 或成高质量本地模型新方向 — gharik · 2026-10-11
- Meta CMU 推出 IdeaScientist,跨领域检索使科研 idea 新颖度从 36% 升至 67% — ZeYanjie · 2026-10-11
- Qwen、Kimi、GLM 已弃用全注意力,8 种注意力设计详解 — julsimon · 2026-10-11
- OpenMed 3.0 发布:Apache-2.0 临床 AI 完全本地运行,拒绝静默回退云端 — dark-night-rises · 2026-10-11