GPT-5.6 在 ALE 刷新成绩

shi_weiyan · x · 2026-07-11

OpenAI 表示,GPT-5.6 Sol 在 Agents' Last Exam (ALE) 上拿到 53.6 分,超出 Claude Fable 5(adaptive)13.1 分。中等推理设置下,它以大约 1/4 的估算成本领先 Fable 5 11.4 分;GPT-5.6 Terra 和 Luna 也在约 1/16 的成本下超过了 Fable 5。

帖子同时补充了 ALE 的背景:这是一个面向前沿 AI agent 的公开评测,收录了 1,500+ 个由专家提供的长周期任务,覆盖 55 个非实体职业,来自 100+ 家机构的 300+ 位专家。评测强调真实职业工作、可复现和基于结果的自动评分。

所属事件:GPT-5.6 在 ALE 基准测试中刷新成绩(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →