GPT-6 Astra 对比 Claude Fable 5.1:跑分领先,实战多为平手

It-zubair-huss · reddit · 2026-09-07

作者汇总两款前沿模型的评测数据对比(同价、同样 1M 上下文):

Astra 明确领先:FrontierMath Tier 4 97.6% vs 87.8%;AutomationBench 41.4% vs 31.4%;BenchCAD 95.9% vs 84.3%。

基本打平:Terminal-Bench 4.0(57.7% vs 55.8%)、Code Arena WebDev 仅差 35 Elo(约 55/45 胜率)。

Fable 5.1 反超:OSWorld 2.0 77.9%。

作者结论:跑分只说明谁更擅长跑分,生产环境建议先在自己栈上实测再决定迁移,并给出三个能暴露真实差异的 prompt 思路。

所属事件:Fable 5.1 与 GPT-6 Astra 48 小时内接连发布、同价对决(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →