GPT-6 Astra 评分风波引发基准测试可信度反思
Artificial Analysis 因 GPT-6 Astra 的评分引发质疑并重构其智能指数,Reddit 随之热议当前还有哪些榜单值得信任。有观点认为封闭、不可复现的 meta 基准测试价值有限,闭源榜单之间的差异可能只是测量噪声;也有人指出接近 99% 的跑分需要警惕,GPT-6 Astra 公布的分数实为「模型 + harness」的系统成绩,且 AAII 的 held-out 数据类型并不难被推断,存在 benchmark 被针对性优化的风险。
2026-09-06 ~ 2026-09-06 · 3 条相关
- 接近 99% 的跑分要警惕:GPT-6 Astra 分数其实是「模型+harness」的系统成绩 — algo_diver · 2026-09-06
- Artificial Analysis 重构指数后,Reddit 热议还有哪个榜单可信 — TheReedemer69 · 2026-09-06
- GPT-6 Astra 评测风波:闭源榜单差异只是测量噪声 — PerformanceRound7913 · 2026-09-06