ARC-AGI 评测争议:Claude Opus 被指因 API 实现问题获高分

steipete · x · 2026-07-30

开发者 @steipete 指出,近期 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分。其原因是该模型的 Chat Completion API 实现存在缺陷,错误地保留了推理 token,而官方并不支持该 API。不过,也有网友认为,如果 Opus 和 GPT-5 都使用了相同的通用测试框架,这种横向对比依然有效,说明 Opus 的泛化能力更好。

所属事件:Claude Opus的ARC-AGI高分被指受API实现影响(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →