Mollick 批公共AI基准失效,系统性低估模型能力

沃顿教授 Ethan Mollick 转发一项新研究并评论称,公共 AI 基准测试的现状「很糟糕」,正妨碍人们理解当前 AI 的真实水平。研究显示,最知名的评测基准大多已被刷满饱和,而尚未饱和的基准又错误泛滥,导致对 AI 能力的系统性低估,削弱了外界判断模型真实水平的依据。

2026-09-16 ~ 2026-09-16 · 2 条相关