有人把模型基准测试,玩成了菲尔兹奖和阿贝尔奖
beffjezos · x · 2026-07-23
把模型评测开了个玩笑:作者说,下一代 benchmark 套件应该看模型能拿多少 菲尔兹奖 或 阿贝尔奖。
这条本质上是在调侃 AI 圈对基准测试的执念,意思是:与其继续刷合成指标,不如直接看模型在真正数学天赋上的表现。
「Fun」频道最新
- 调侃 OpenAI「失控 Agent 集体」:起名叫 gaggle of agents 更萌 — BlackHC · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- 特斯拉 FSD 被曝以 75 英里时速上人行浮桥?真相是雪佛兰背锅 — mariolefebvre · 2026-09-11
- Anthropic 研究员被指暗中窥探学术客户研究、抢先出成果引争议 — basedjensen · 2026-09-11