Claude Opus的ARC-AGI高分被指受API实现影响
开发者 @steipete 指出 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分,原因是该模型的 Chat Completion API 实现存在缺陷。不过,网友 @umikenjsf 对此提出不同看法,认为如果 Claude Opus 与 GPT-5 的分数都是基于相同的通用 ARC 测试框架得出的,那么在测试框架一致的前提下,Opus 的泛化能力依然优于 GPT-5,对比依然成立。
2026-07-30 ~ 2026-07-30 · 2 条相关
- 第 1 集:Claude Opus的ARC-AGI高分被指受API实现影响(2026-07-30,2 条)
- 第 2 集:ARC-AGI-3官方开源基准测试代码库(2026-07-30,4 条)
- 网友质疑:若测试框架一致,Opus 泛化能力优于 GPT-5 — umike_njsf · 2026-07-30
- ARC-AGI 评测争议:Claude Opus 被指因 API 实现问题获高分 — steipete · 2026-07-30