Proof Bench 实测:Opus 5.5 中档推理性价比偏低,Astra 表现超预期
JenniferHli · x · 2026-09-26
- 评测机构 ValsAI 在 Proof Bench v1.1 上测了 GPT-6 Astra、Opus 5 和 Opus 5.5 在 low/medium/high/xhigh/max 全部推理档位下做数学证明的表现。
- Rayan Krishnan 的判断:两家实验室对「medium 推理档」的定价都校准失准——Opus 5.5 相对性能太贵,而 GPT-6 Astra 的表现好于必要的水平。
「模型」频道最新
- 博主实测:Opus 5.5思考越强成绩越差,Max档成本暴涨精度反降 — davidyin44 · 2026-09-26
- LibertAI 开源 Deem 9B:基于 Qwen3.5,基准落后 Jev 约 5 个点 — Pokenhagen · 2026-09-26
- Peter Steinberger:编码不用 Claude,靠 Codex 加 OC harness — steipete · 2026-09-26
- Anthropic 数学解题落后 OpenAI,算力储备或是主因 — haider1 · 2026-09-26
- Opus 4.6 对比 Opus 5.5:实测两代模型生成 Hytale 世界观 — Angaisb_ · 2026-09-26
- OpenAI 持久化 agent 或命名「o」,旧品牌报道再被翻出 — Dullydude · 2026-09-26