Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分

marktenenholtz · x · 2026-10-07

Mark Tenenholtz 提出:大多数超过 2-3 个月仍未饱和的基准,之所以还有提升空间,是因为任务本身写得糟糕、评分实现得很差,或两者兼有——而非模型能力真有差距。这是对当前 AI 榜单可信度的直接质疑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →