OpenAI 回应基准测试质疑:GDPval 趋于饱和

emollick · x · 2026-07-31

OpenAI 官方针对基准测试动态做出回应。对于 ARC-AGI-3,人类测试者的得分约为 48%。

关于 GDPval,OpenAI 表示该测试目前已接近饱和,因此官方正将重心转移至其他评测项目。虽然 GDPval 曾是一个优秀的测试,但其任务设定相比真实世界场景过于明确。目前仍未饱和的重要基准包括 ARC-AGI、原版 GDPval、METR 长周期任务以及 ASI 网络安全任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →