质疑 OpenAI 数学评测口径:解决 100 难题却不说尝试了多少道

burny_tech · x · 2026-09-22

博主 marcusgnt 公开质疑 OpenAI 的评测宣传口径:OpenAI 宣称模型解决了 100 个数学开放难题,但没有说明一共尝试了多少道题。他强调,报告解题的成功率(百分比)是基本的科学规范,能让外界正确理解模型的真实能力,并呼吁 OpenAI 为了数学社区补上这个简单数据。主帖为对该质疑的转发认可。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →