GPT-5.6 在 ALE 刷新成绩

shi_weiyan · x · 2026-07-11

OpenAI 表示,GPT-5.6 Sol 在 **Agents' Last Exam (ALE)** 上拿到 **53.6** 分,超出 Claude Fable 5(adaptive)**13.1** 分。中等推理设置下,它以大约 **1/4** 的估算成本领先 Fable 5 **11.4** 分;GPT-5.6 Terra 和 Luna 也在约 **1/16** 的成本下超过了 Fable 5。 帖子同时补充了 ALE 的背景:这是一个面向前沿 AI agent 的公开评测,收录了 **1,500+** 个由专家提供的长周期任务,覆盖 **55** 个非实体职业,来自 **100+** 家机构的 **300+** 位专家。评测强调真实职业工作、可复现和基于结果的自动评分。

所属事件:GPT-5.6 在 ALE 基准测试中刷新成绩(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →