GPT-5.6 在 ALE 刷新成绩
shi_weiyan · x · 2026-07-11
OpenAI 表示,GPT-5.6 Sol 在 Agents' Last Exam (ALE) 上拿到 53.6 分,超出 Claude Fable 5(adaptive)13.1 分。中等推理设置下,它以大约 1/4 的估算成本领先 Fable 5 11.4 分;GPT-5.6 Terra 和 Luna 也在约 1/16 的成本下超过了 Fable 5。
帖子同时补充了 ALE 的背景:这是一个面向前沿 AI agent 的公开评测,收录了 1,500+ 个由专家提供的长周期任务,覆盖 55 个非实体职业,来自 100+ 家机构的 300+ 位专家。评测强调真实职业工作、可复现和基于结果的自动评分。
所属事件:GPT-5.6 在 ALE 基准测试中刷新成绩(2 条相关)→
「模型」频道最新
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RTX 3060 全本地语音助手复刻 GPT Live 官方演示,6 分钟跑完全程 — liampetti · 2026-09-11
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11