GPT-6 Astra 早期评测:自动化基准 41.4% 破纪录,领先上代 10 个百分点
sandersted · x · 2026-09-04
开发者 @bryanhelmig 分享 GPT-6 Astra 早期体验的两点观察:
- 基准成绩:在他们的自动化基准(automation bench)上拿到 41.4%,大幅打破此前由 fable 5.1 保持的 31.4% 纪录,领先 10 个百分点;
- 文风:模型“人格”没有被训练搞坏,写作连贯、不做作,比以往模型更舒服自然。
作者以“1/?”结尾,暗示还有后续长帖。此为早期体验者爆料,非官方数据,未经证实。
「模型」频道最新
- OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响 — ShakeelHashim · 2026-09-04
- K2 Horizon 发布 6 款全开源模型,0.9B 到 375B 附全部训练代码与数据配方 — aliscodes · 2026-09-04
- 早期用户实测 GPT-6 Astra:8 分钟用 Blender 捏出狼人,17 分钟造出世界模拟器 — TheMoonMidas · 2026-09-04
- swyx 烧掉 200 亿 token 深测 Astra:训练模型、标注数据全包,成本低至每小时 6 美元 — charliermarsh · 2026-09-04
- OpenAI Kaiser:去年圣诞 Codex 突变连我们自己都说不清原因 — a_karvonen · 2026-09-04
- ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型 — GregKamradt · 2026-09-04