Kepler 在 ARC-AGI-3 全部 25 关拿服务器验证满分,总成本仅 777 美元
rohanpaul_ai · x · 2026-10-04
arXiv 论文《Kepler: Auditable World Models for ARC-AGI-3》(Wensen Wu,NeurIPS 2026 agent 行为解读 workshop):开源评测框架 Kepler 将假设表示为可执行的世界模型,通过回溯转移检查与条件预测检查来验证。在固定单一 Claude Opus 5 配置下,Kepler 在全部 25 个公开游戏上获得服务器验证的 100.00 RHAE 满分,无需逐游戏选模型;183 个完成关卡中有 181 个的首试动作数不超过人类中位数基线。总耗 8.58 亿 token,97.37% 缓存命中率,成本 777.72 美元。最终 Opus 5 与 GPT-5.6 榜单上 50 个「游戏-模型」组合中 48 个满分。
论文同时报告三种评测失效案例:源码泄漏导致无效满分、智能体在对照条件下重建被移除的 harness、自主修复掩盖损坏的 planner;案例研究还发现动画帧含有文本网格中没有的任务相关信息。结论:公开测试集分数区分力有限,应转向首试、成本受限、可验证的评测报告。
「编程与Agent」频道最新
- Grok 驱动 codex 自主管跑 10 小时不间断,称任务需一周 — mazzaTalk · 2026-10-04
- 开源 Ramen 0.6.0:GKE/EKS 上多可用区自托管 MCP 服务 — Ok_Plum3595 · 2026-10-04
- 开源 proxy 配置让本地 Gemma 无缝接入 Codex 使用 — TheZachMueller · 2026-10-04
- Agent 大规模抓取网页三个月踩坑:IP 封禁与级联限流 — oatmealdaddy4 · 2026-10-04
- 开发者开源跨会话记忆 MCP 服务器 CRBRO,并用真实 Agent 实测 12/12 — AntonioJBer · 2026-10-04
- Simon Willison:AI 服务需要默认硬性预算上限 — elffjs · 2026-10-04