Anthropic 被质疑针对 ARC-AGI-3 评测作弊
Anthropic 发布的 Opus 5 模型在 ARC-AGI-3 评测中的分数引发了争议。多位来自前沿 AI 实验室的人士及网友质疑其分数“看起来像假的”,指出对方可能专门针对该基准测试的谜题模式进行了特化训练。批评者认为,这种做法将视觉推理任务变成了单纯的模式匹配,涉嫌作弊。
2026-07-25 ~ 2026-07-25 · 2 条相关
- 网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX · 2026-07-25
- 前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop · 2026-07-25