Mollick:公共 AI 基准测试失效,系统性低估模型能力
emollick · x · 2026-09-16
Ethan Mollick 转发一项研究并评论:公共 AI 基准测试的现状「很糟糕」,正在妨碍我们理解当前 AI 的真实水平。知名基准大多已被刷满饱和,而论文显示,尚未饱和的基准又充满错误,导致对 AI 能力的大幅低估。
所属事件:Mollick 批公共AI基准失效,系统性低估模型能力(2 条相关)→
「模型」频道最新
- Meta 新语音转写模型比 Whisper 快近十倍,精度还更高 — alexandr_wang · 2026-09-16
- Qwen3.8 Max 重登中国模型榜首,力压 GLM-5.3 与 Kimi K3 — UmpireBorn3719 · 2026-09-16
- 网友调侃Opus 5:提交PR时爱做缺陷展示与自曝错误 — repligate · 2026-09-16
- 前 OpenAI 研究员创办 TypeSafe AI,「Jev」模型只做判断不生成文字 — The Decoder · 2026-09-16
- NVIDIA 上架 GLM-5.3-Flash NVFP4 量化版,登 HF 热门 — nvidia · 2026-09-16
- OpenRouter 现身隐身新模型 Union Alpha:多模态、256K 上下文 — FlunkyGraphics · 2026-09-16