Opus 5 在 ARC-AGI 1/2 上进步,疑似靠代数化解题
herbiebradley · x · 2026-07-25
Herbie Bradley 读完 Opus 5 的 system card 后认为,模型在 ARC-AGI 1 和 2 上相比 4.7/4.8 有明显进步。
他特别注意到 system card 里对一个 ARC-AGI-3 风格任务的描述:模型似乎把视觉谜题转化成显式代数问题来解,这在他看来是一种很可训练的策略。他据此推测,这次提升很可能来自一个专门针对这类 puzzle 的研究项目,甚至可能用了有独占协议的数据供应商。
「模型」频道最新
- AutomationBench 图表显示 Opus 5 更强于长程智能体任务 — daniel_mac8 · 2026-07-25
- Claude Opus 5 进入 GitHub Copilot 和 Microsoft Foundry — DanWahlin · 2026-07-25
- CursorBench 3.2 显示 Claude Opus 5 仅落后 Fable 5 0.5 分,成本减半 — EricBuess · 2026-07-25
- Hyperagent:Opus 5 更强,但 GPT-5.6 Sol 更便宜更好落地 — TawohAwa · 2026-07-25
- 传 Opus 5 性能碾压 Fable 5,下一代模型竞争白热化 — haider1 · 2026-07-25
- Qwen3.5-9B 非审查 GGUF 变体登上 Hugging Face 趋势榜 — DavidAU · 2026-07-25