Anthropic 用 ARC-AGI-3 测 Opus 5 新推理能力

typewriters · x · 2026-07-25

Anthropic 正在用 ARC-AGI-3 来衡量 Opus 5 的新问题解决能力。

配图给出的是一张“总评测成本 vs 得分”的散点图:

这条信息的重点不是单纯刷分,而是把 ARC-AGI-3 作为一种更偏“新颖推理/未知任务解决”能力的前沿测评。

所属事件:Anthropic 发布 Claude Opus 5(35 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →