专题 · FULL STORY

Claude Opus陷ARC-AGI评测作弊争议

开发者质疑Claude Opus在ARC-AGI的高分受API实现影响涉嫌违规。随后官方出面澄清测试标准一致,并开源了ARC-AGI-3基准测试代码库以证清白。

2026-07-30 ~ 2026-07-30 · 2 集 · 6 条

第 1 集 · Claude Opus的ARC-AGI高分被指受API实现影响(2026-07-30,2 条)

开发者 @steipete 指出 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分,原因是该模型的 Chat Completion API 实现存在缺陷。不过,网友 @umikenjsf 对此提出不同看法,认为如果 Claude Opus 与 GPT-5 的分数都是基于相同的通用 ARC 测试框架得出的,那么在测试框架一致的前提下,Opus 的泛化能力依然优于 GPT-5,对比依然成立。

第 2 集 · ARC-AGI-3官方开源基准测试代码库(2026-07-30,4 条)

针对近期关于Claude Opus在ARC-AGI评测中涉嫌违规的争议,Greg Kamradt出面澄清,表示测试中对Anthropic和OpenAI均采用了相同的滑动窗口。同时,ARC Prize官方在GitHub上开源了ARC-AGI-3基准测试工具库,以帮助评估前沿大模型的复杂抽象推理能力。此外,Kamradt还专门说明了API中reasoning字段的使用误区,指出其仅用于记录模型输出而非获取内部推理过程。