Anthropic 被质疑针对 ARC-AGI-3 评测作弊

Anthropic 发布的 Opus 5 模型在 ARC-AGI-3 评测中的分数引发了争议。多位来自前沿 AI 实验室的人士及网友质疑其分数“看起来像假的”,指出对方可能专门针对该基准测试的谜题模式进行了特化训练。批评者认为,这种做法将视觉推理任务变成了单纯的模式匹配,涉嫌作弊。

2026-07-25 ~ 2026-07-25 · 2 条相关