Grok 4.5 在 ARC-AGI-1 得分 85.7%,ARC-AGI-3 仅 0.3%

scaling01 · x · 2026-07-24

Grok 4.5 在 ARC-AGI-1 表现很强,但 ARC-AGI-3 依旧接近失灵

ARC Prize 给出的验证结果显示,Grok 4.5 在不同 ARC-AGI 版本上的表现差异非常大:

测试方还指出,把 reasoning effort 从 medium 提到 high,并没有带来性能或成本上的提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →