ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型
GregKamradt · x · 2026-09-04
Greg Kamradt(ARC Prize / ARC-AGI 负责人)在与 Gary Marcus 的对话中澄清了基准测试方法论:他们早就知道可以把人类智慧「烘焙」进测试 harness(如精心设计的系统提示词)来让 v3 取得好成绩,也见过一些很夸张的系统提示词。
但问题在于——那样测量的其实是人类智能而非模型本身的能力。因此主办方需要对「到底问哪些问题、用哪些测试」采取更严谨的原则性标准,确保评测的是模型而非提示工程。
「模型」频道最新
- OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏 — ShakeelHashim · 2026-09-04
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04