Fortune 曝 OpenAI 悄悄上调 GPT-6 Astra 评测指标,竞对成绩反被调低
jeremyakahn · x · 2026-09-05
据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日下午发布 GPT-6 Astra 博客公告后,持续修改多个评测基准的数字:部分改动让 Astra 成绩变好,而竞争对手 Anthropic 模型的同期数字反而变差。
这次发布过程本身也不寻常:博客原计划美东时间下午 2 点上线,但拖延了近两小时才可正常访问;OpenAI 官方账号下午 3:32 发推时链接报错,随后 CEO Sam Altman 发帖称「遇到了一点小问题」。
该报道由 jeremyakahn 转发,并附上 Fortune 原文链接,引发对厂商自报评测指标可信度的质疑。
「模型」频道最新
- Fable 5.1 中等档力追平上代高档,切档不再破坏 prompt cache — lydiahallie · 2026-09-05
- 博主实测 GPT-6 Astra 首任务即揪出 GPT5.6 Sol 两个 Bug — op7418 · 2026-09-05
- OpenAI 的「啰嗦惩罚」:长度校正后 Astra 医疗基准领先优势缩水近半 — imjustnewatai · 2026-09-05
- GPT-6 Astra 实测:重新设计开发板上的组件与走线 — jasonkneen · 2026-09-05
- 投资人称 GPT-6 Astra 展现实力,OpenAI 与 Anthropic 远超对手 — firstadopter · 2026-09-05
- GPT-6 Astra 一发通过所有模型都翻车的私人幽默评测 — mattbeane · 2026-09-05