Kepler 在 ARC-AGI-3 全部 25 关拿服务器验证满分,总成本仅 777 美元

rohanpaul_ai · x · 2026-10-04

arXiv 论文《Kepler: Auditable World Models for ARC-AGI-3》(Wensen Wu,NeurIPS 2026 agent 行为解读 workshop):开源评测框架 Kepler 将假设表示为可执行的世界模型,通过回溯转移检查与条件预测检查来验证。在固定单一 Claude Opus 5 配置下,Kepler 在全部 25 个公开游戏上获得服务器验证的 100.00 RHAE 满分,无需逐游戏选模型;183 个完成关卡中有 181 个的首试动作数不超过人类中位数基线。总耗 8.58 亿 token,97.37% 缓存命中率,成本 777.72 美元。最终 Opus 5 与 GPT-5.6 榜单上 50 个「游戏-模型」组合中 48 个满分。

论文同时报告三种评测失效案例:源码泄漏导致无效满分、智能体在对照条件下重建被移除的 harness、自主修复掩盖损坏的 planner;案例研究还发现动画帧含有文本网格中没有的任务相关信息。结论:公开测试集分数区分力有限,应转向首试、成本受限、可验证的评测报告。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →