ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型

GregKamradt · x · 2026-09-04

Greg Kamradt(ARC Prize / ARC-AGI 负责人)在与 Gary Marcus 的对话中澄清了基准测试方法论:他们早就知道可以把人类智慧「烘焙」进测试 harness(如精心设计的系统提示词)来让 v3 取得好成绩,也见过一些很夸张的系统提示词。

但问题在于——那样测量的其实是人类智能而非模型本身的能力。因此主办方需要对「到底问哪些问题、用哪些测试」采取更严谨的原则性标准,确保评测的是模型而非提示工程。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →