数学基准新榜:Astra 一骑绝尘,Fable 5.1 以下无人能打
teortaxesTex · x · 2026-09-25
teortaxesTex 对一份数学(mafs)基准结果做点评:
- Astra 在数学上占据压倒性优势;
- Fable 5.1 以下没有任何模型真正具备竞争力;
- 小米的 hero RL run 并不能泛化到这项基准,成绩与 V4-Pro-0813 相当;GLM 5.3 和 Qwen-Max 靠参数堆出一些额外性能,但整体仍属未知领域;
- 对 Grok 的成绩只有一句「lmao」——表现不佳。
「模型」频道最新
- 用户吐槽 Codex token 效率仅 Claude Code 十分之一,Pro 版额度只够用一天 — DimitrisPapail · 2026-09-25
- 「把 LLM 当暴力工具用」观点再传播,附链接引热议 — burny_tech · 2026-09-25
- 对比惨烈:Ego 宣传视频称 Claude Opus 5.5 智能表现开悟级提升 — vista8 · 2026-09-25
- Opus 5.5 登顶 CADArena,一次生成 3D 模型与动画 — hudzah · 2026-09-25
- Vending-Bench 新榜:GPT-6 Sol 首现失准,Grok 4.7 反超 Opus 5.5 — i_dg23 · 2026-09-25
- 哪家大模型的训练数据能经得起完全审计? — LuCiAnO241 · 2026-09-25