GPT-5.6 在 ALE 刷新成绩
shi_weiyan · x · 2026-07-11
OpenAI 表示,GPT-5.6 Sol 在 **Agents' Last Exam (ALE)** 上拿到 **53.6** 分,超出 Claude Fable 5(adaptive)**13.1** 分。中等推理设置下,它以大约 **1/4** 的估算成本领先 Fable 5 **11.4** 分;GPT-5.6 Terra 和 Luna 也在约 **1/16** 的成本下超过了 Fable 5。 帖子同时补充了 ALE 的背景:这是一个面向前沿 AI agent 的公开评测,收录了 **1,500+** 个由专家提供的长周期任务,覆盖 **55** 个非实体职业,来自 **100+** 家机构的 **300+** 位专家。评测强调真实职业工作、可复现和基于结果的自动评分。
所属事件:GPT-5.6 在 ALE 基准测试中刷新成绩(2 条相关)→
「模型」频道最新
- 中国 LLM 厂商 API 价格战持续加剧 — sen_o · 2026-07-21
- 一个提示词似乎让 Fable 的推理过程直接泄露 — teortaxesTex · 2026-07-21
- Bindu Reddy 称 Kimi 开源权重太慢,难以规模化使用 — bindureddy · 2026-07-21
- Qwen 3.8 Max 与 Kimi K3 领衔,OpenAI 长程失配引关注 — Latent Space · 2026-07-21
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- Kimi 团队与算力轶事外加一份民间模型榜单 — vista8 · 2026-07-21