OpenAI 回应基准测试质疑:GDPval 趋于饱和
emollick · x · 2026-07-31
OpenAI 官方针对基准测试动态做出回应。对于 ARC-AGI-3,人类测试者的得分约为 48%。
关于 GDPval,OpenAI 表示该测试目前已接近饱和,因此官方正将重心转移至其他评测项目。虽然 GDPval 曾是一个优秀的测试,但其任务设定相比真实世界场景过于明确。目前仍未饱和的重要基准包括 ARC-AGI、原版 GDPval、METR 长周期任务以及 ASI 网络安全任务。
「模型」频道最新
- Grok 2 语音模式疑似延期:X平台上线时间悄然改为“即将推出” — teortaxesTex · 2026-07-31
- Anthropic 发布 Claude Opus 5:编码与知识工作登顶,成本减半 — dl_weekly · 2026-07-31
- Osmosis AI 借 YC 算力与强化学习,挑战闭源大模型 — togethercompute · 2026-07-31
- ChatGPT 限流机制暗坑:无法自查额度且不与 Codex 同步 — Sauers_ · 2026-07-31
- 模型幻觉还是记忆?Opus 5 输出中惊现标注员留言 — aiamblichus · 2026-07-31
- Google 开放 Gemini Robotics ER 2 模型 API — ericjang11 · 2026-07-31