Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去
GaryMarcus · x · 2026-07-22
Gary Marcus 转发并强调了一条关于模型评测方法的提醒:很多团队正在悄悄把评测对象从单纯的 LLM,变成了 LLM + harness(外部包装/脚手架),但排行榜名称并没有同步改写。
核心问题是:如果被测系统已经变了,却还沿用同一个 benchmark 名字,比较结果就会失真。 Marcus 认为这件事非常重要,若不理解这一点,就很难真正看懂当下 AI 评测在发生什么。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22
- OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机 — OpenAI · 2026-07-22