CAIS 发布 HLE-Diamond:1000 题精修基准,GPT-6 Astra 拿 60.6% 居首
steipete · x · 2026-09-24
CAIS 与 Scale AI 联合发布 HLE-Diamond,即 Humanity's Last Exam(HLE)历时一年清洗精修后的子集,共 1000 题(500 推理题 + 500 专家知识题),设计为闭卷可答。
无工具主榜(推理 high 设置):
- GPT-6 Astra:60.6%(推理 75.6% / 知识 45.6%)
- Claude Opus 5.5:55.0%(63.2% / 46.8%)
- Claude Fable 5.1:51.3%(62.0% / 40.6%)
- Claude Opus 5:38.6%;Gemini 3.8 Flash:34.3%;GPT-6 Sol:33.8%;GPT-5.6 Sol:31.2%;Muse Spark 1.3:25.4%;Grok 4.7:23.4%
加工具(web+code)后大幅提升:GPT-6 Astra 升至 82.9%,Claude Opus 5.5 升至 73.9%,Claude Opus 5 升至 69.1%。官方同时给出了 agentic 系统在 HLE-Diamond 上的推荐评测设置。
所属事件:CAIS 发布精修基准 HLE-Diamond,GPT-6 Astra 以 60.6% 居首(2 条相关)→
「模型」频道最新
- ChatGPT 语音接入插件并由 GPT-6 驱动,可语音操作办公全流程 — Dimillian · 2026-09-24
- 爆料讨论:某前沿模型比 Astra 领先 8 个月、仅超前趋势 2 个月 — scaling01 · 2026-09-24
- Navier-Stokes 证明耗 1300 亿输出 token,OpenAI 重度用户日均仅数十亿 — scaling01 · 2026-09-24
- Meta Muse 4 万评分达 4.88:产品、分发、价格三线碾压式竞争 — RihardJarc · 2026-09-24
- 重跑 Audi 3D 建模对比:只有 GPT-6 Astra 与 Opus 5.5 能打 — kevinkern · 2026-09-24
- 自建 200 题校准测试:模型自报 90% 把关可信度 — colinmcnamara · 2026-09-24