LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑

ChrSzegedy · x · 2026-10-07

研究者发布新基准 LeanLean,用于评估 LLM 压缩 Lean 代码库的能力。背景是 LLM 生成的数学证明越来越长——Claude 证明费马大定理的 Lean 代码达 1300 万行。

榜单结果:Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →