网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练
VraserX · x · 2026-07-25
有用户在 X 上发文指责 Anthropic 在 ARC-AGI-3 评测中“作弊”。其指出,Anthropic 基本上是专门针对该基准测试的谜题模式进行了专门训练,将视觉推理任务转化为了明确的代数问题,并反复演练了这种特定策略。该用户认为这并非通用智能的体现,而仅仅是基准测试优化,并感叹现在的基准测试分数已经失去了意义。
「模型」频道最新
- Claude Opus 5 已能生成接近顾问水准的表格和幻灯片 — alexalbert__ · 2026-07-25
- Claude Opus 5 知道背景却仍会误读整份文档 — teortaxesTex · 2026-07-25
- 早期反馈称 Opus 5 文字输出更像“4o 式水文”,但底层更聪明 — jdjohnson · 2026-07-25
- 有人反馈 Anthropic 新模型比 Fable 更快也更强 — emax · 2026-07-25
- 发布博客预告:FrontierCode 智能体编码基准打平 — hardmaru · 2026-07-25
- Moonshot 开源权重 Kimi K3 逼近美国顶级模型,改写 AI 经济 — OmarUFlorez · 2026-07-25