Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分,幻觉率数字反复变动
mark_k · x · 2026-09-05
据 Fortune 报道,OpenAI 在 GPT-6 Astra 发布前后悄悄修改了多项 benchmark 数据,部分修改让 Astra 更好看、竞品更差。典型案例:Astra 幻觉率从 4.2% 改为 2%,后又改回 4.2%;Anthropic Fable 5.1 的 FrontierMath 成绩从 87.8% 降到 78%,再回升到 83%。事件发生在 Astra 发布博客先发布、撤回、再以不同数字重发的诡异延迟期间。OpenAI 回应称博客延迟与 benchmark 无关,eval 结果会随 checkpoint、harness 和推理配置而变化。
所属事件:Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分数据(3 条相关)→
「模型」频道最新
- 接近 99% 的跑分要警惕:GPT-6 Astra 分数其实是「模型+harness」的系统成绩 — algo_diver · 2026-09-06
- 单张 H100 跑 DiffusionGemma,H200 或达 6000 tok/s — bodonoghue85 · 2026-09-06
- Naval 引用 DeepSeek 科普:教骑车用 SFT,学会骑车靠 RL — McDonaghMatthew · 2026-09-06
- 博主爆料:OpenAI 或已部分破解纳维-斯托克斯问题 — scaling01 · 2026-09-05
- 数千条 MMO 任务文案实测:LLM 局部通顺、全局崩坏,20-30 轮纠正仍无用 — HLCYSWAP · 2026-09-05
- GPT-6 Astra 现身容量报错?用户 20 小时用量从 90% 骤降到 81% — sick_burns2000 · 2026-09-05