ARC-AGI-3 上的高分 harness 结果
WalterReade · x · 2026-07-17
这条转发主要在夸“action efficiency charts”更主流,但引用内容里给出了实质信息:
- 新的 [schema] harness 在 ARC-AGI-3 Public set 上表现很强
- 使用 Opus 4.8 + Fable 5 时达到 99% RHAE
- 使用 GPT-5.6 Sol 时也达到 95.35%
引用者的核心判断是:应当用“信息效率”而不只是“成本”来衡量智能,[schema] 被描述为让 LLM “像物理学家一样思考”的框架。
所属事件:Schema harness 引爆 ARC-AGI-3 讨论(14 条相关)→
「研究」频道最新
- LagTag 染色质记录研究正式发表,AI 助力基因史追踪 — arjunrajlab · 2026-09-03
- SIGGRAPH Asia 2026 差旅资助开放申请,9 月 18 日截止 — tomaszbednarz · 2026-09-03
- 100 个已知错误实测 AI 同行评审:最强系统抓 71 个,多模型集成达 93 个 — alejandroll10 · 2026-09-03
- EMNLP 论文:从零预训练对比发现罗马化文本跨语言迁移最优 — TuhinChakr · 2026-09-03
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03