Mollick:公共 AI 基准测试失效,系统性低估模型能力

emollick · x · 2026-09-16

Ethan Mollick 转发一项研究并评论:公共 AI 基准测试的现状「很糟糕」,正在妨碍我们理解当前 AI 的真实水平。知名基准大多已被刷满饱和,而论文显示,尚未饱和的基准又充满错误,导致对 AI 能力的大幅低估。

所属事件:Mollick 批公共AI基准失效,系统性低估模型能力(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →