接近 99% 的跑分要警惕:GPT-6 Astra 分数其实是「模型+harness」的系统成绩
algo_diver · x · 2026-09-06
作者对 AAII 基准与 GPT-6 Astra 发布的分数提出系统性反思:
AAII 的价值与局限
- held-out 数据类型不难被推断,「benchmark maxing」结构上难以根除;但 AAII 把所有模型放在同一接口与环境下比较,已属现实中的最大公平
- 更危险的是只看一个数字就排座次的消费方式,尤其发生在决策层
GPT-6 Astra 的争议
- 发布的接近 99% 的分数,与其说是模型单独的成绩,不如说是「模型 + harness + context 管理 + memory + retry + 工具 + 推理预算」合成的系统成绩
- 在没有明显架构突破的前提下分数突然饱和,应先检查评测条件改了什么;给现有模型配自研 harness 大概率也能大幅提分
更大的隐忧
- 一旦各家都带着自家最优 harness、专有工具、激进 retry 策略出分,同一张分数表里模型 A 是纯模型分、B 含 agent harness、C 含专有工具,数字将失去可比性
- 以后看 benchmark 必须逐项确认用了什么 harness、工具、内存、重试次数和推理预算,模型对比会越来越累
结论:模型性能与加 harness 后的系统性能必须分开呈现,OpenAI 显然知道这一点,但发布信息的呈现方式正在模糊这条界线。
「漫话AGI」频道最新
- 用脑机传感器给模型做 RL,让 AI 学会唤起人类情绪? — gabriel1 · 2026-09-06
- OpenAI 与 Anthropic 被指压着大量未公开的内部模型研究结果 — MoonL88537 · 2026-09-06
- 研究:AI 占比 12.5% 提升人类共识 8%,75% 时共识被 AI 主导 — rohanpaul_ai · 2026-09-06
- Zack Korman:AI「网络模型」补不完漏洞,安全靠苦功而非更多 token — gnukeith · 2026-09-06
- 前自由译者自述:预判翻译将被 ML 取代,转身去做自动化自己的事 — mariofilhoml · 2026-09-06
- 何时该用人类心智解释 AI agent?两位研究者发文系统回应 — Dr_Atoosa · 2026-09-06