一篇数学 AI 实战文,顺带测了多个模型
BLUECOW009 · x · 2026-07-21
John Ennis 记录了自己把 AI 用在数学研究中的体验,核心不是泛泛而谈,而是总结了哪些用法真正有效、哪些会翻车。
配图里还给出了一张针对微分几何任务的模型实测排名:
- 5.6 Sol 最擅长搭建证明结构和最后修补,但有时会把结论修得比原命题更窄。
- Claude Fable 5 擅长深度推导和长篇重写,但偶尔依赖一个漂亮却未被证明的全局假设。
- Sakana Fugu Ultra 在挑错和 hostile review 上很强,但速度慢、过于字面化。
- Kimi K3 则以提出最怪、最原创的机制见长。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22