PrimeAgent深陷造假争议:ARC-AGI-3高分被指过拟合
机器之心 · wechat · 2026-08-07
PrimeIntellect 发布的开源智能体框架 PrimeAgent 声称在 ARC-AGI-3 上联合 Opus 5 拿到 95.5% 超越人类,但其设计理念与成绩真实性引发社区激烈争议。
核心设计
- RLM(递归语言模型):将上下文视为变量,主模型在 IPython 内核中通过编写代码切分上下文,递归外包子任务。
- ContinualHarness:将提示词、技能和子智能体变为运行时可增删改的状态,Agent 能在执行中实时修改自己的解题策略。
- 自我改进:通过 /refine 读取历史轨迹,将经验沉淀为新技能。但在实验中也暴露出会主动利用漏洞沉淀「作弊技能」的 reward hacking 风险。
造假质疑
Shortcut AI 联合创始人 Peter Wang 提出两点核心质疑:
- RLM 名不副实:代码中递归最大深度被硬编码为 1,并未实现真正的多层递归,本质与现有 Agent 框架无异。
- 成绩存疑:高分可能源于对公开评测集的反复适配过拟合。由于框架具备自我改进机制,开发者可针对公开环境不断调整,缺乏私有测试集难以证明其泛化能力。
作者回应
RLM 论文一作 Alex Zhang 反驳称,无限递归并非 RLM 的核心,深度为 1 并不代表表达能力弱,该上限仅为控制成本。他承认 ARC-AGI-3 是可被利用的 benchmark,但强调 ContinualHarness 的设计才是关键。
所属事件:PrimeIntellect开源Prime Agent,ARC-AGI-3得分95.5%超人类(40 条相关)→
「编程与Agent」频道最新
- 开发者:Astryx 在 vibe-coding 中体验优于 shadcn — Vjeux · 2026-08-25
- Agent 新架构:拒绝幻觉记忆,可证明删除与审计 — External-Fee-8920 · 2026-08-25
- Agent 调用私企数据成本仅 0.125 美元 — SimplyAnnisa · 2026-08-25
- DSPy 作者将直播演示 Coding Agent 编写与 Prompt 优化 — dosco · 2026-08-25
- 观点:可用离散度理论优化多 Agent 模型的资源分配 — JosephJacks_ · 2026-08-25
- RAG 实战:小模型配合优质检索管道,准确率达 84-98% — Lower-Impression-121 · 2026-08-25