GPT-6.1 sol 纯推理反超对手:HLE-Diamond 拿 67.4%,仅用 4k token
haider1 · x · 2026-09-30
X 用户 haider1 分享了据称是 GPT-6.1 sol 在 HLE-Diamond 基准上的成绩(未经官方证实):
- 总分:6.1 sol 53.2%,Fable 5.1 50.7%,Opus 5.5 54.6%
- 纯推理子项上 6.1 sol 反超两者:67.4%,对 Fable 5.1 的 60.8% 和 Opus 5.5 的 62.4%
- 更突出的是 token 效率:6.1 sol 仅用约 4k tokens,而 Fable 5.1 用 16k、Opus 5.5 用 10k
若属实,说明该模型在推理效率上有明显优势——同等或更高准确率下 token 消耗只有竞品的四分之一到二分之一。数据来自第三方账号,尚待官方确认。
「模型」频道最新
- Anthropic 警告 GLM-5.3 可自主写漏洞利用,遭质疑打压开源竞品 — ziv_ravid · 2026-09-30
- ChatGPT Pro $200 档 6-Pro 网页聊天砍到每周 100 次 — triestdain · 2026-09-30
- GPT-6.1 Sol 实测:105 个植入 bug 修 44 个,成本仅为上代 1/15 — PawelHuryn · 2026-09-30
- 开源模型逼近 Mythos Preview,GLM 5.3 发布仅隔 5 个月 — mariofilhoml · 2026-09-30
- Artificial Analysis 首尔首办活动,聚焦 AI 基准与单任务成本 — ArtificialAnlys · 2026-09-30
- GPT 6.1 Sol 上 BridgeBench:仅比前代高 3 分,落后 GPT 6 Astra 82 分 — RexDouglass · 2026-09-30