Ethan Mollick 转发新论文:未饱和基准错误泛滥,严重低估 AI 能力

emollick · x · 2026-09-16

Ethan Mollick 指出公共 AI 基准测试的现状「很糟糕」,正在削弱我们判断当前 AI 真实水平的能力。他转发的论文显示:最知名的评测指标大多已被打满(饱和),而尚未饱和的基准又充斥大量错误,导致这些测试系统性地大幅低估了 AI 的实际能力。论文链接见原帖。

所属事件:Mollick 批公共AI基准失效,系统性低估模型能力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →