ARC-AGI-3上出现高分结果
xiuyu_l · x · 2026-07-17
这条帖转述了一个关于 ARC-AGI-3 的新结果:名为 schema 的 harness 在公开集上取得了非常高的成绩。
文中给出的关键数字是:
- 使用 Opus 4.8 + Fable 5 达到 99% RHAE
- 使用 GPT-5.6 Sol 达到 95.35% RHAE
- 作者称 schema 让 LLM “像物理学家一样思考”
转发评论则强调,这类结果说明:可编程的世界模型可能显著提升模型/智能体表现,而在更强的 agentic 模型出现后,符号化发现可能成为解决问题的重要路径。
所属事件:Schema harness 引爆 ARC-AGI-3 讨论(14 条相关)→
「模型」频道最新
- OpenAI 模型对比基准重新纳入 Claude,引发圈内心照不宣的解读 — hrishioa · 2026-09-04
- 自建编码评测VulcanBench-SWE v4:超时升至10小时防失真 — ChrisUniverse · 2026-09-04
- 模型在计算生物与统计推理上能力显著持续提升 — anshulkundaje · 2026-09-04
- KOL 批 OpenAI 仓促发 Astra:逼 Anthropic 在领先与原则上二选一 — scaling01 · 2026-09-04
- 自称 GPT-6「Astra」饱和 ARC-AGI-3,Brockman 宣称「AGI 时代来临」 — ShafeDogg · 2026-09-04
- Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策 — repligate · 2026-09-04