同场基准补测:GPT-6 Astra 低档 27 分、中档 34 分修 Bug

PawelHuryn · x · 2026-09-10

基准测试作者 PawelHuryn 回复补充:GPT-6 Astra 的 low 档此前已测得 27/105,medium 档得 34/105,结果已于 9 月 4-5 日发布,读者可在其榜单页面用过滤器查看对比。

与同系列其他结果(Opus 5 max 27 个/$51.33、DeepSeek V4.1 Flash 24 个/$1.80)对照,GPT-6 Astra medium 档是当前该基准上修 bug 最多的模型。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →