GPT-5.6 尝试解 3300 道数学难题,完成率约 10%
littmath · x · 2026-08-25
Sasho 回顾十年前整理的数学开放问题列表,并测试 AI (GPT-5.6 Sol xhigh) 在这些问题上的表现。
- 测试了 3,300 道开放问题,其中约 170 个找到反例,170 个给出证明。
- 整体完成率约为 10%。
- 不同问题的难度差异巨大,目前 AI 解决的多为相对简单的“琐事”。
「模型」频道最新
- GLiNER2.5 发布:弃用枚举改边界预测,支持全文长上下文提取 — bclavie · 2026-08-25
- 创意写作榜单新增 GLM-5.3、Gemini-3.7-flash 等模型 — sam_paech · 2026-08-25
- 开源 AI token 调用量周增百倍,称将超闭源 — bindureddy · 2026-08-25
- 有语音识别 STT 的权威排行榜吗? — Elibroftw · 2026-08-25
- 开源模型追赶闭源速度加快,差距正迅速缩小 — iScienceLuvr · 2026-08-25
- 前沿模型新版本并非总是更强,三大实验室均出现过性能倒退 — bindureddy · 2026-08-25