GPT-6 在 GDPval-AA v2 输给 Kimi K3,OpenAI 与评测方双双沉默
ChrisGPT · x · 2026-09-08
作者困惑于 Artificial Analysis 坚持其评测结论:GPT-6 在真实任务基准 GDPval-AA v2 上的得分低于 Kimi K3,而 OpenAI 对此异常沉默——尤其在其刚宣称 AGI 之后。可能的解释包括测试计分方式有误,或模型答对但评测方未考虑更合理的解读(OpenAI 员工此前对其他基准也这样辩解过)。作者指出,尽管该基准表现落后,在众多私有集合和私有基准上 GPT-6 的通用推理明显更强;YouTuber 们「这不是 AGI」的论调多基于这个倒退点,并指责 OpenAI 在其他领域 benchmaxing。双方至今都没给出正式解释。
「模型」频道最新
- 「没有LLM能解」的图像转动画难题,GPT-6 Astra最简提示解决 — BLUECOW009 · 2026-09-08
- 实测 Astra 用量超支:同一任务耗尽 5 小时额度仍未完成 — Grand0rk · 2026-09-08
- 博主实测新模型 Astra:迄今最接近 AGI 的使用体验 — haider1 · 2026-09-08
- 传 Google Astra 完整权重泄露,消息引发关注(未证实) — teortaxesTex · 2026-09-08
- 搭载 GPT-6 Astra 的 995 美元机器人零样本开柜门,滑手后自主重试成功 — DeryaTR_ · 2026-09-08
- 博主实测 Astra 生成定制着色器:表现惊艳到让人不安 — teortaxesTex · 2026-09-08