开放评测挑战称 Opus 5 的 ARC-AGI-3 提升并未转移

rbhar90 · x · 2026-07-25

作者主张要有更多开放、可复核的基准测试,因为前沿实验室的“强推理能力”叙事已经和巨大的商业利益绑得太紧。

文中引用了 Opus 5 在 ARC-AGI-3 与作者自建的 Witness 测试集上的对比:

核心结论是:如果真实任务分布与评测集不一致,单一基准分数可能会高估推理能力的进步。

所属事件:Opus 5 刷爆 ARC-AGI-3 引发热议与造假质疑(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →