GPT-6 Astra 对比 Claude Fable 5.1:跑分领先,实战多为平手
It-zubair-huss · reddit · 2026-09-07
作者汇总两款前沿模型的评测数据对比(同价、同样 1M 上下文):
Astra 明确领先:FrontierMath Tier 4 97.6% vs 87.8%;AutomationBench 41.4% vs 31.4%;BenchCAD 95.9% vs 84.3%。
基本打平:Terminal-Bench 4.0(57.7% vs 55.8%)、Code Arena WebDev 仅差 35 Elo(约 55/45 胜率)。
Fable 5.1 反超:OSWorld 2.0 77.9%。
作者结论:跑分只说明谁更擅长跑分,生产环境建议先在自己栈上实测再决定迁移,并给出三个能暴露真实差异的 prompt 思路。
所属事件:Fable 5.1 与 GPT-6 Astra 48 小时内接连发布、同价对决(9 条相关)→
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11