同场基准补测:GPT-6 Astra 低档 27 分、中档 34 分修 Bug
PawelHuryn · x · 2026-09-10
基准测试作者 PawelHuryn 回复补充:GPT-6 Astra 的 low 档此前已测得 27/105,medium 档得 34/105,结果已于 9 月 4-5 日发布,读者可在其榜单页面用过滤器查看对比。
与同系列其他结果(Opus 5 max 27 个/$51.33、DeepSeek V4.1 Flash 24 个/$1.80)对照,GPT-6 Astra medium 档是当前该基准上修 bug 最多的模型。
「编程与Agent」频道最新
- Google 简化 Gemini API skills,助 API 代码正确率升至 87% — patloeber · 2026-09-10
- Grok Build 终端界面获赞:可在 TUI 内直接渲染图片 — chongdashu · 2026-09-10
- DeepSeek 智能体蜂群写复杂代码碾压 K3,2 小时烧掉 70 元 — teortaxesTex · 2026-09-10
- Reddit 开发者困惑:数百个 AI Agent 共享一个 API 密钥安全吗 — SheepherderFree3931 · 2026-09-10
- Stripe 工程实践:规格先行委派 AI,SDK 原型两周工期缩至两天 — dl_weekly · 2026-09-10
- 30 年老兵炮轰 agentic workflow:成熟代码库上从未见过好结果 — cgouguen · 2026-09-10