Ethan Mollick 转发新论文:未饱和基准错误泛滥,严重低估 AI 能力
emollick · x · 2026-09-16
Ethan Mollick 指出公共 AI 基准测试的现状「很糟糕」,正在削弱我们判断当前 AI 真实水平的能力。他转发的论文显示:最知名的评测指标大多已被打满(饱和),而尚未饱和的基准又充斥大量错误,导致这些测试系统性地大幅低估了 AI 的实际能力。论文链接见原帖。
所属事件:Mollick 批公共AI基准失效,系统性低估模型能力(2 条相关)→
「研究」频道最新
- 去年底 AI 研究者预测:千禧年数学难题 2054 年前无解,现实已提前 — Tolopono · 2026-09-17
- UChicago 研究员招 AI×经济学 predoc,可共一作发论文 — ethayarajh · 2026-09-17
- 领域训练是常数增益还是改变 scaling 指数?值得追问 — eigenron · 2026-09-17
- 开放任务 RL 像「入轨即自由落体」:只看每 GPU 时间的进步量 — tensorqt · 2026-09-17
- 本地跑什么基准才有用?Reddit 讨论自建推理评测体系 — JustTooKrul · 2026-09-17
- MAST 多语言智能体搜索基准延长提交至 9 月 20 日 — beirmug · 2026-09-17