Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%
The Decoder · rss · 2026-07-26
The Decoder 报道称,Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%,接近把此前 GPT-5.6 Sol 的 7.8% 纪录翻了四倍。这个基准被设计用来衡量更接近“通用智能”的能力。
基准开发者还表示,这个模型自主推导出了 reflection equations,这是他们此前没在其他模型身上见过的行为,因此他们把这视作更强逻辑推理能力的迹象。
「模型」频道最新
- Reddit 截图显示 Gemini 疑似泄露了提示词 — BloonLord · 2026-07-26
- Macaron-V1 上线 Hugging Face,基于 Qwen3.6-35B-A3B — MundanePercentage674 · 2026-07-26
- POCKET-35B 宣称可 CPU 跑到 59 tok/s,手机也能本地运行 — Powerful_Evening5495 · 2026-07-26
- 实测主流视频 agent 后,作者仍把 Runway Agent 排第一 — taherdhanera · 2026-07-26
- SemiAnalysis: Kimi K3 大幅超越 Nemotron,黄仁勋联盟模式输给中国自由竞争 — FinanceYF5 · 2026-07-26
- Claude 再次传出故障,状态页却仍显得正常 — Ubunta · 2026-07-26