有人把模型基准测试,玩成了菲尔兹奖和阿贝尔奖

beffjezos · x · 2026-07-23

把模型评测开了个玩笑:作者说,下一代 benchmark 套件应该看模型能拿多少 菲尔兹奖 或 阿贝尔奖。

这条本质上是在调侃 AI 圈对基准测试的执念,意思是:与其继续刷合成指标,不如直接看模型在真正数学天赋上的表现。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →