新数学基准OEIS Open:Opus 4.8解决30%未解猜想
xeophon · x · 2026-08-12
tmkadamcz 发布了一项全新的数学基准测试 OEIS Open,包含 492 个已形式化为 Lean 语言的未解数学猜想。
测试结果显示,在提供基础工具且每个猜想设定 50 美元预算的条件下,Claude Opus 4.8 已经能够成功生成 Lean 证明,解决了其中 30% 的问题。这标志着大语言模型在高级数学推理和形式化证明领域取得了新的突破。
「模型」频道最新
- 悬置21年数学难题被人类破解,GPT与Claude均告失败 — anshulkundaje · 2026-08-13
- 像艺术评论家一样评测 AI:Grok 4.6 占星能力实测 — karinanguyen · 2026-08-13
- Kimi K3 接入 GitHub Copilot,实测一句话生成游戏 — film_girl · 2026-08-13
- MiniMax H3 实测对比 SD2.5:运镜更平滑,商业可用性占优 — FellMentKE · 2026-08-13
- 80张RTX 5090跑满Kimi K3全量模型,Bittensor网络提供半价平替API — markjeffrey · 2026-08-13
- Grok 4.6 上线 Cursor 等平台,首周提供双倍用量 — XFreeze · 2026-08-13