GPT-6 Astra 登顶 ErdosBench:226 道公开数学难题,较上代仅提升 5-10%
scaling01 · x · 2026-09-08
ErdosBench(基于 Erdős 问题精选的 226 道公开数学难题基准)发布者 przchojecki 公布测试结果:GPT-6 Astra xhigh 排名第一,但相对 GPT-5.6 Sol xhigh 并非质的飞跃。
- Astra 比 Sol 多解决了几道题,科研写作更强、夸大表述更少(有时甚至偏保守)
- 在测试的各项数学研究技能上,Astra 相对上一代约有 5%-10% 的提升
- 基准远未饱和,作者期待 GPT-7
「模型」频道最新
- HF 集合页确认 Nex-N2.5 三款开源模型已上线,最大 1.6T 参数 — AdinaYakup · 2026-09-08
- Nex-AGI 上架三款 Apache 2.0 开源模型,最大 1.6T 参数 — AdinaYakup · 2026-09-08
- DeepSeek 后训练负责人吴宇称 V4.1 将降价 — teortaxesTex · 2026-09-08
- DeepSeek 空闲时段输入价格回调至涨价前,输出价仍为原价两倍 — teortaxesTex · 2026-09-08
- Artificial Analysis 又更新榜单,被指未做严谨评测 — Tall_Abrocoma_3533 · 2026-09-08
- 安全研究人质疑:实验室是否对特定文件名做过 RL 训练 — kieranklaassen · 2026-09-08