专题 · FULL STORY

ARC-AGI-3跑分引争议与评测机制大反思

大模型在ARC-AGI-3基准测试中的高分接连引发造假与过拟合争议。随着开发者质疑评测公平性,官方出面澄清规则并开源代码库,业界也就缺失人类基线等问题展开反思。

2026-07-25 ~ 2026-08-01 · 9 集 · 64 条

第 1 集 · Opus 5 ARC-AGI-3 高分引发造假与过拟合争议(2026-07-25,11 条)

Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的成绩,领先同侪 3 倍。然而这一高分随即在 AI 社区引发广泛的造假与过拟合质疑,多名用户及业内人士对其真实能力表示怀疑,并引发了关于评测体系有效性与商业利益绑定的反思。

已确认

目前可以确认的是,Opus 5 的具体分数为 30.2%,且该成绩在业内引发了强烈的信任危机。网友 @sdnr8 质疑闭源模型不透明,认为其高分可能并非依赖“纯模型”能力,而是外部套用了 loop 或 harness 等代理框架。网友 @VraserX 则直接指责 Anthropic “作弊”,认为其专门针对该基准的谜题模式进行了特化训练,将视觉推理转化为明确的代数问题并反复演练。此外,自称来自前沿 AI 实验室的人员也向 @flowersslop 透露,该分数“看起来像假的”,要么是刷分过度,要么是竞争对手严重低估了 Anthropic 的领先幅度。Chris Szegedy (@ChrSzegedy) 与 @DrSingularity 均明确指出 ARC-AGI 跟 AGI 没什么关系,尽管后者承认 AI 确实在持续变强。Gary Marcus 也发声强调,在基准上刷分并不等于接近 AGI,他认为分数提升更可能源于定向优化而非抽象推理能力的真正泛化。

尚未确认

关于 Opus 5 是否真的使用了外部代理框架,或者 Anthropic 是否确实进行了针对性的特化训练,目前均停留在社区猜测与指控阶段,相关爆料并未提供实质性的技术证据。

为什么重要

此次争议不仅关乎 Anthropic 一家的声誉,更折射出业界对 AI 评测体系有效性的深层担忧。一方面,如 @morqon 转述的观点所指出的,过快饱和的评测会失去区分度,有人认为该基准在第一天就已接近“被解完”;另一方面,@burnytech 转发的讨论表明,越来越多人默认 ARC-AGI 的进展主要来自针对性的 RL 环境,呼吁 ARC-AGI-4 减少公开演示以防止模型过拟合。@JasonBotteril 也指出,将基准直接命名为 AGI 几乎注定会诱导实验室去针对性优化。此外,@rbhar90 强调前沿实验室的“强推理能力”叙事已与巨大商业利益深度绑定,主张建立更多开放、可复核的基准测试(如自建的 Witness 测试集),并指出 Opus 5 在 ARC-AGI-3 上的提升并未转移到其他测试集中。@inductionheads 也指出,如果模型确实在类似 ARC-AGI 的强化学习环境里训练过,那么其表现便无法证明“通用泛化”。这表明现有的公开基准测试正面临严峻的方法论挑战。

第 2 集 · 深扒 Opus 5 隐藏推理机制与 ARC-AGI 成绩(2026-07-25,2 条)

近期有技术分析将 Opus 5 系统卡中出现的隐藏变量等推理迹象,与 ARC 风格测试中的推导行为相结合,试图拼凑出未来智能代理的技术线索。随后有作者对相关数据进行了补充澄清,明确其获得的 30.16 分 ARC-AGI-3 成绩采用的是 RHAS 评估,并进一步换算了背后的算力趋势。

第 3 集 · Anthropic 基准测试表现引发社区信任危机(2026-07-25,2 条)

近期关于 Anthropic 基准测试分数的讨论在社区引发信任危机。尽管数据显示其表现本身并不差,甚至优于 Opus 4.8,但仍弱于 Fable。有观点指出,只要 Anthropic 在某项基准测试中表现一般,大家就更容易怀疑该测试的可靠性。此外,Anthropic 较高的 ECI 指标进一步放大了分数差距,加剧了外界的困惑与质疑。

第 4 集 · Gary Marcus 批评 ARC-AGI 命名易误导大众(2026-07-27,2 条)

近日,Gary Marcus 等人指出“ARC-AGI”这一基准测试的命名容易引发误导。由于 AGI 本身是一个定义模糊且充满争议的概念,直接将其用作测试名称,会让大众误以为该基准是在真正且直接地评估模型是否达到通用人工智能。这场讨论并非针对具体的模型跑分或榜单成绩,而是聚焦于基准测试命名对公众认知的潜在影响,呼吁在评估标准上保持严谨。

第 5 集 · 前沿AI评测缺失人类基准,人机协同评估成新焦点(2026-07-29,4 条)

随着AI基准测试日益复杂,沃顿商学院教授Ethan Mollick指出前沿AI评测正丧失与人类能力的对比这一核心环节,缺乏人类基线数据成为致命隐患。同时,业界呼吁应为人机组合建立独立评测标准,因为单独衡量模型性能会忽略AI辅助下人类真正能完成什么。斯坦福等机构也提出了CollabSkill框架,以重新评估真实职业任务中的人机协作能力。

第 6 集 · 优化记忆管理设置,GPT-5.6 在 ARC-AGI-3 跑分翻三倍(2026-07-30,27 条)

OpenAI 官方证实,通过在 Responses API 中开启“保留推理”与“上下文压缩”两项设置,GPT-5.6 Sol 在 ARC-AGI-3 公开测试集的得分从 13.3% 飙升至 38.3%(提升 188%),达到 SOTA 水平,且 token 消耗大幅降至原先的 1/6。该发现表明,测试框架的记忆管理机制而非纯粹的模型推理能力,才是决定模型在复杂长程任务中表现的关键。

已确认

  • GPT-5.6 Sol 此前在 ARC-AGI-3 基准测试中默认表现不佳,开发者 @sandersted 最早实测指出了这一问题。
  • 开启 ChatGPT 和 Codex 内部使用的两项特定 API 设置后,模型得分提升约 3 倍(从 13.3% 提升至 38.3%),同时 token 使用效率提高约 6 倍(消耗量降至原先的 1/6)。
  • 这两项关键设置分别为保留推理与上下文压缩,允许模型记住先前的思考过程,并跨越多个上下文窗口进行连续处理。
  • OpenAI 工程师 @ilanbigio 指出,标准测试框架会在每步操作后丢弃模型的推理过程,并在上下文填满时丢失早期操作记录,导致模型在隔离环境下评测表现受限。

为什么重要

  • 该发现挑战了当前业界通用的隔离式模型评测方法。开发者 @Angaisb 等人指出,通过优化测试框架就能轻易解决复杂任务,这意味着单纯比较模型在裸跑基准测试中的分数,并不能真实代表不同 AI 系统的实际智能水平。
  • 产品框架(如 ChatGPT 和 Codex 的内部机制)与模型能力的深度协同,对模型在复杂任务上的表现有决定性影响,性能瓶颈往往在于上下文管理而非模型本身。

还有 7 条相关讨论 →

第 7 集 · ARC-AGI 3评测机制遭开发者集体质疑(2026-07-30,9 条)

近期多位开发者对 ARC-AGI 3 基准测试的公平性与评测机制提出强烈质疑,认为当前的测试框架设计、评分规则甚至测试动机都存在严重失真,无法真实衡量通用人工智能的能力。

已确认

  • 框架限制记忆:开发者 @Glittering-Neck-2505 与 @teortaxesTex 指出,当前的统一测试框架故意阻止推理智能体跨操作维护上下文,迫使模型不断“遗忘”。这种为了跨提供商标准化(使用相同的补全风格端点且不传回推理日志)而限制 Agent 长期记忆的做法,无法有效衡量模型的真实效率。
  • 评测框架严重影响得分:开发者 @ImaginaryDinner2710 与 @ilanbigio(经 @dkundel 转述)指出,模型跑分严重依赖测试框架。以 ARC-AGI 为例,OpenAI 模型仅因调用方式不当得分仅有 13%,修正后飙升至 38%。此外,仅对 Harness 的设置进行两处调整,就使 Claude 3.5 Sonnet 的成绩获得了大幅提升。合理追踪推理过程并使用上下文压缩机制,对于跑出真实高分至关重要。
  • 评分机制遭批:开发者 @mgostIH 发现,当前的测试框架已让 ARC-AGI-3 趋于饱和,只需对模型进行少量强化学习(RL)就能大幅提升分数。此外,他强烈批评该基准采用解题百分比的二次方计算,认为这毫无理由且纯属“造神”。
  • 被指恶意调参:开发者 @iruletheworldmo 提出严厉批评,认为 ARC-AGI 测试被用作吸引公众注意力的催化剂。他指出,测试方疑似出于恶意调低了模型的得分,从而制造出该基准测试极难达到饱和的假象。
  • 基础模型测试不公:ML Street Talk(经 @burnytech 转发)指出,现代 AI 本质上是混合神经符号系统,单次上下文的推理窗口不足以完成适应,因此直接用基础模型测试 ARC-AGI3 并不公平。

尚未确认

  • 测试方是否存在主观“恶意”调参以制造测试极难的假象(目前仅为 @iruletheworldmo 的严厉指控)。
  • 某些模型在内部 preview 测试中是否使用了与公开评测不同的 harness(目前为 @LiangSong850509 提出的质疑)。
  • 业界是否能就建立并采用统一的 Agent 框架来测试不同模型达成共识(目前仅为 ML Street Talk 提出的建议)。

为什么重要

  • 影响基准公信力:如果测试机制容易被少量 RL 攻破并趋于饱和,评分公式存在争议,甚至存在人为压低分数的可能,那么该基准的权威性将大打折扣。
  • 评测需贴合实际:开发者强调,在真实开发场景中模型总是结合特定智能体框架运行。在设计跨平台标准化测试时,不应以牺牲 Agent 核心能力(如长期记忆)为代价,行业亟需抛弃“裸跑”基准。

第 8 集 · Claude Opus的ARC-AGI高分被指受API实现影响(2026-07-30,2 条)

开发者 @steipete 指出 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分,原因是该模型的 Chat Completion API 实现存在缺陷。不过,网友 @umikenjsf 对此提出不同看法,认为如果 Claude Opus 与 GPT-5 的分数都是基于相同的通用 ARC 测试框架得出的,那么在测试框架一致的前提下,Opus 的泛化能力依然优于 GPT-5,对比依然成立。

第 9 集 · ARC-AGI-3评测规则澄清与官方代码库开源(2026-07-30,5 条)

近期大模型在ARC-AGI-3基准测试中的评测方式引发争议。为此,ARC-AGI创始人François Chollet与官方成员Greg Kamradt集中澄清了评测规则与API用法,并开源了官方测试代码库,以确保不同模型间评估的公平性与透明度。

已确认

  • 禁用定制外挂:François Chollet明确规定,禁止在测试中使用专门为解决该基准测试而开发的定制工具,或包含测试格式与内容知识的系统。
  • 公平测试机制:针对Claude Opus涉嫌违规的争议,Greg Kamradt澄清,官方在测试Anthropic和OpenAI的模型时,使用了完全相同的“滑动窗口”约定。
  • 开源评测工具:Greg Kamradt分享了ARC Prize官方的开源代码库arc-agi-3-benchmarking。该工具提供完整的环境配置与运行指南,支持配置各类API Key以评估大模型在复杂抽象推理任务上的表现。
  • API字段释义:Greg Kamradt纠正了对API中可选reasoning字段的误区,强调该字段并非用于获取模型内部的思维链(CoT),而是仅用于记录和关联模型的外部输出。

为什么重要

统一且开源的评测标准有助于消除各大模型提供商在跑分过程中的“作弊”嫌疑。明确禁用定制工具并公开测试代码,为开发者提供了可复现的评估环境,进一步巩固了ARC-AGI作为前沿大模型智能评估标杆的权威性。