又见「难题」被吊打:Xeophon 嘲讽评测榜常年翻车
xeophon · x · 2026-09-17
Xeophon 转发自己旧帖吐槽:「所谓 hard 评测基准又一次被简单的不菜打败」——意指很多被标注为高难度的评测,模型其实靠扎实的基础能力就能通过,是出题方的问题而非模型极限。作者称这条「每周转发都不过时」。
所属事件:LLM 评测翻车频现:grader 一修分数翻倍(2 条相关)→
「Fun」频道最新
- AI 帮记者报税还揪出人类会计师漏掉的错误 — sebkrier · 2026-09-17
- 用 ChatGPT-6 加 After Effects 复刻 1970 年代影院质感画面 — azed_ai · 2026-09-17
- AI 生成「棉花糖珊瑚」图走红:干态场景下的柔软珊瑚造景 — MoonL88537 · 2026-09-17
- 又见六指梗:新版 GPT 图像生成仍会露馅 — aziz4ai · 2026-09-17
- 芝大审稿人最毒评语:华丽描述瀑布,却没人叫水管工 — KarlMuth · 2026-09-17
- Schmidhuber 亲自确认:1993 年已解决神经网络自参考问题 — SchmidhuberAI · 2026-09-17