Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去
GaryMarcus · x · 2026-07-22
Gary Marcus 转发并强调了一条关于模型评测方法的提醒:很多团队正在悄悄把评测对象从单纯的 LLM,变成了 LLM + harness(外部包装/脚手架),但排行榜名称并没有同步改写。
核心问题是:如果被测系统已经变了,却还沿用同一个 benchmark 名字,比较结果就会失真。 Marcus 认为这件事非常重要,若不理解这一点,就很难真正看懂当下 AI 评测在发生什么。
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11