GPT-5.6 在 ALE 基准测试中刷新成绩

OpenAI 宣布其新模型 GPT-5.6 在 Agents' Last Exam (ALE) 基准测试中取得突破,其中 Sol 版本斩获 53.6 分,成功超越 Claude Fable 5。此前数据显示,GPT-5.6 整体已处于 ALE-Bench 前沿水平,特别是 Luna 和 Terra 两个版本均展现出强大的智能体综合能力,进一步巩固了该系列模型在复杂任务评测中的领先地位。

2026-07-10 ~ 2026-07-11 · 2 条相关

事件全程(共 20 集)→