质疑 OpenAI 数学评测口径:解决 100 难题却不说尝试了多少道
burny_tech · x · 2026-09-22
博主 marcusgnt 公开质疑 OpenAI 的评测宣传口径:OpenAI 宣称模型解决了 100 个数学开放难题,但没有说明一共尝试了多少道题。他强调,报告解题的成功率(百分比)是基本的科学规范,能让外界正确理解模型的真实能力,并呼吁 OpenAI 为了数学社区补上这个简单数据。主帖为对该质疑的转发认可。
「模型」频道最新
- Grok 4.7 发布:编程评测登顶,价格仅对标模型一半 — FinanceYF5 · 2026-09-22
- Grok 4.7 发布:价格不变,Terminal-Bench 成绩从 20.3% 翻倍至 38% — FinanceYF5 · 2026-09-22
- Anthropic 状态页显示 Claude 多个模型错误率升高 — corvad · 2026-09-22
- antirez 与 tenobrus 联手泼冷水:Jev 演示皆夸大,离真可用还远 — burny_tech · 2026-09-22
- 马斯克确认:Grok 90 天从榜外杀回前三,4.8 下月再战 — elonmusk · 2026-09-22
- Anthropic 多款 Claude 模型错误率升高,官方排查中 — ClaudeAI-mod-bot · 2026-09-22