LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑
ChrSzegedy · x · 2026-10-07
研究者发布新基准 LeanLean,用于评估 LLM 压缩 Lean 代码库的能力。背景是 LLM 生成的数学证明越来越长——Claude 证明费马大定理的 Lean 代码达 1300 万行。
榜单结果:Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。
「研究」频道最新
- 数学家吐槽 OAI 对 Hodge 猜想进展的营销言过其实 — ctjlewis · 2026-10-07
- Sandberg 提醒:预印本往往比终稿更诚实 — anderssandberg · 2026-10-07
- 烧掉 3000 亿 tokens 攻 Hadwiger–Nelson 问题,下界从 5 提升到 6-7 色 — soumitrashukla9 · 2026-10-07
- 数学家发现沙法列维奇猜想两个反例,littmath 调侃「重复计数」 — littmath · 2026-10-07
- 冻结 7B 模型外挂记忆原型:128 次召回命中 118 次 — Nearby_Indication474 · 2026-10-07
- 与 Claude 合写论文:LLM 让预注册预测变得轻松有趣 — anderssandberg · 2026-10-07