Scale AI 发布 HLE-Diamond:精修版人类最后考试,最强模型得 60.6%
sandersted · x · 2026-09-24
Scale AI 联合 CAIS 发布 Humanity's Last Exam 的精修子集 HLE-Diamond,用于更可靠地衡量前沿模型能力。
- 历时一年,结合社区反馈对子集进行审查与修订
- 当前测试的最强模型整体得分 60.6%
- 团队预计该基准对前沿模型的有效信号还能维持 6-12 个月
所属事件:CAIS 发布精修版 HLE-Diamond 基准,GPT-6 Astra 以 60.6% 居首(3 条相关)→
「模型」频道最新
- ChatGPT 语音可调用插件并接入 GPT-6 三款模型,全球推送 — romainhuet · 2026-09-24
- GPT-6 Luna 医疗成绩超上代旗舰,价格便宜约 34 倍 — BorisMPower · 2026-09-24
- 爆论:模型「变笨」或因异构 GPU/TPU 混用推理,质量不一 — michellechen · 2026-09-24
- 网友吐槽:别把消费级产品「Max」式命名套路搬到 LLM 身上 — scaling01 · 2026-09-24
- 罗马团队 Limite 1B 开源,竞赛数学成绩胜过数十倍体量模型 — tensorqt · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24