GPT-6 在 GDPval-AA v2 输给 Kimi K3,OpenAI 与评测方双双沉默

ChrisGPT · x · 2026-09-08

作者困惑于 Artificial Analysis 坚持其评测结论:GPT-6 在真实任务基准 GDPval-AA v2 上的得分低于 Kimi K3,而 OpenAI 对此异常沉默——尤其在其刚宣称 AGI 之后。可能的解释包括测试计分方式有误,或模型答对但评测方未考虑更合理的解读(OpenAI 员工此前对其他基准也这样辩解过)。作者指出,尽管该基准表现落后,在众多私有集合和私有基准上 GPT-6 的通用推理明显更强;YouTuber 们「这不是 AGI」的论调多基于这个倒退点,并指责 OpenAI 在其他领域 benchmaxing。双方至今都没给出正式解释。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →