Claude Opus的ARC-AGI高分被指受API实现影响

开发者 @steipete 指出 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分,原因是该模型的 Chat Completion API 实现存在缺陷。不过,网友 @umikenjsf 对此提出不同看法,认为如果 Claude Opus 与 GPT-5 的分数都是基于相同的通用 ARC 测试框架得出的,那么在测试框架一致的前提下,Opus 的泛化能力依然优于 GPT-5,对比依然成立。

2026-07-30 ~ 2026-07-30 · 2 条相关

事件全程(共 2 集)→