PrimeAgent深陷造假争议:ARC-AGI-3高分被指过拟合

机器之心 · wechat · 2026-08-07

PrimeIntellect 发布的开源智能体框架 PrimeAgent 声称在 ARC-AGI-3 上联合 Opus 5 拿到 95.5% 超越人类,但其设计理念与成绩真实性引发社区激烈争议。

核心设计

造假质疑

Shortcut AI 联合创始人 Peter Wang 提出两点核心质疑:

作者回应

RLM 论文一作 Alex Zhang 反驳称,无限递归并非 RLM 的核心,深度为 1 并不代表表达能力弱,该上限仅为控制成本。他承认 ARC-AGI-3 是可被利用的 benchmark,但强调 ContinualHarness 的设计才是关键。

所属事件:PrimeIntellect开源Prime Agent,ARC-AGI-3得分95.5%超人类(40 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →