Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分数据
据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日发布 GPT-6 Astra 博客公告前后,悄悄修改了多项 benchmark 评测数据,部分改动让 Astra 表现更好、竞品 Anthropic 的成绩反而被调低。典型案例是 Astra 的幻觉率从 4.2% 一度被改为 2%,且相关数字在发布前后反复变动,引发对评测透明度的质疑。
2026-09-05 ~ 2026-09-05 · 3 条相关
- 第 1 集:OpenAI 发布 GPT-6 Astra:高价旗舰、长程 Agent 与安全争议(2026-09-04,189 条)
- 第 2 集:GPT-6 Astra 刷爆 ARC-AGI-3,零推理 token 引隐式推理猜想(2026-09-04,10 条)
- 第 3 集:OpenAI 工程师:按 token 计价失真,应按任务算成本(2026-09-04,4 条)
- 第 4 集:GPT-6 Astra 被指 token 效率惊人 性价比成隐藏杀招(2026-09-05,3 条)
- 第 5 集:网友实测:GPT-6 Astra 排版与推理表现胜过 GPT-5.6 Sol(2026-09-05,3 条)
- 第 6 集:Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分数据(2026-09-05,3 条)
- 第 7 集:用户实测称 GPT-6 Astra 登顶 agentic CAD 榜单(2026-09-05,2 条)
- Fortune 曝 OpenAI 悄悄上调 GPT-6 Astra 评测指标,竞对成绩反被调低 — jeremyakahn · 2026-09-05
- Fortune 曝 OpenAI 悄改 GPT-6 Astra 跑分,幻觉率数字反复变动 — mark_k · 2026-09-05
另有 1 条近重复转述:mark_k