GPT-6 Astra 登顶 Terminal-Bench-Science,超越 Fable 5.1
burny_tech · x · 2026-09-04
据 askalphaxiv 评测,GPT-6 Astra 在 Terminal-Bench-Science 0.1 上登顶,超过刚发布的 Fable 5.1。此前 Fable 5.1 以 52.6% 的成绩大幅领先 Fable 5(24.7%)和 GPT-5.6 Sol(22.4%),成为自动科研(autoresearch)最强的模型,如今位置已被刷新。
作者指出一个趋势:OpenAI 和 Anthropic 在模型发布博客中都首选报告 Terminal-Bench Science,说明各家实验室正把「智能体化科学研究能力」当作衡量模型质量的新试金石,每次发版都在把这个方向往前推。
「模型」频道最新
- Matt Shumer 实测 GPT-6 Astra:首个敢放手让它用电脑的模型 — mattshumer_ · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- Qwen 3.8 27B 对比 3.6:质量升 8%,耗时却长 5 倍 — DerTomsn · 2026-09-04
- 爆料称 GPT-6 Astra 用超 10 万张 GPU 训练,规模创 OpenAI 纪录 — BLUECOW009 · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型获正名,但离 AGI 还远 — Gary Marcus · 2026-09-04
- 用户质疑额度消耗异常,官方称 KV cache 一直开启、正扩容缓存命中 — arthurcolle · 2026-09-04