网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练

VraserX · x · 2026-07-25

有用户在 X 上发文指责 Anthropic 在 ARC-AGI-3 评测中“作弊”。其指出,Anthropic 基本上是专门针对该基准测试的谜题模式进行了专门训练,将视觉推理任务转化为了明确的代数问题,并反复演练了这种特定策略。该用户认为这并非通用智能的体现,而仅仅是基准测试优化,并感叹现在的基准测试分数已经失去了意义。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →