Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分:幻觉率 4.2% 一度改成 2%
mark_k · x · 2026-09-05
据 Fortune 报道,OpenAI 在 9 月 3 日发布 GPT-6 Astra 的博客后,悄悄修改了多项评测基准数据,部分改动让 Astra 看起来更强、而竞品 Anthropic 的模型变差:
- Astra 的幻觉率最初报告为 4.2%,被改为 2%,随后又改回 4.2%
- Anthropic Fable 5.1 的 FrontierMath 成绩从 87.8% 被改为 78%,后又变动
- 发布过程也不寻常:博客原定下午 2 点上线,但近两小时后才可正常访问
目前 OpenAI 方面暂无公开回应,事件已引发对厂商自报基准数据可信度的质疑。
所属事件:Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分数据(3 条相关)→
「模型」频道最新
- LLM 棋艺不行?让 Astra 现场写个引擎对战中级棋力机器人 — MikePFrank · 2026-09-06
- Astra 电脑操作实测翻车:拖拽编辑器建页失败,但仍是进步 — BLUECOW009 · 2026-09-06
- Astra 在 harness 构建任务上令人失望,不敌 Fable 5.1 — HarveenChadha · 2026-09-06
- GPT-6 Astra 在自家 CPU 上跑 DOOM 达 20+ FPS,前代仅 1 FPS — Angaisb_ · 2026-09-06
- 用户用 GPT-6 Astra 自主调研飞机制造并搭出可运行 3D 工厂仿真 — deanwball · 2026-09-06
- GPT-6 Astra 登顶手术 AI 通才榜,仍输给小千倍专用小模型 — ddonoho · 2026-09-06