新基准 ObviousBench:人类全对送分题,GPT-Luna 拿下两冠
adamallcock · reddit · 2026-09-23
Reddit 用户 adamallcock 介绍自建基准 ObviousBench:所有题目对人类都是送分题、但对 LLM 很难,满分 100% 是可能达到的,因此核心玩法不是比分数,而是比「达到某分数线(90%/95%/99%+)花多少钱和 token」。
当前成绩:GPT-Luna 在 Max 和 Medium 两档拿下第一,Low 档排第三。排行榜见 obviousbench.com,论文 DOI 已发布在 Zenodo。
「模型」频道最新
- 第三方实测:Claude Opus 5.5 出图更精细,成本却是 GPT-6 Sol 的 13 倍 — testingcatalog · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最佳视觉设计能力 — burny_tech · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23
- Claude 5.5 被曝持续生成用户回合,模型行为再现异常 — BlackHC · 2026-09-23
- 代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark — almmaasoglu · 2026-09-23
- 信封上画草图,Grok 4.7 几分钟内做出可玩解谜游戏 Lightweave — luismbat · 2026-09-23