LLM 能力的锯齿状边界,只是「有人做出自动评分器」的地图
jessi_cata · x · 2026-09-14
jessicata 引用 Jon Stokes 的文章《人人都该极度怀疑 AI benchmark》,并点出核心论断:LLM 能力的锯齿状边界并非智能的固有属性,而只是一张「哪些任务有人搞出了自动评分器」的地图——即评测成绩反映的是我们能把什么自动化打分,而非模型的真实智能。
文章主张对 AI 基准测试保持极度怀疑,认为历史在计算领域并非押韵而是质变,当下围绕 benchmark 的叙事与真实能力之间存在系统性偏差。
「模型」频道最新
- 用户反映 Codex 5x 套餐用量异常:每 10 分钟掉约 1%,重置周期竟变 10 天 — Andreeez · 2026-09-14
- Claude 会给自己写 bug 报告,作者直呼意外 — Aizkmusic · 2026-09-14
- GPT-6 Astra 确认事实盘点:百万上下文、2.5 倍价格与 Critical 网安风险 — Thirumalaivasan_GJ · 2026-09-14
- Harvey以Kimi K3为底座自训法律模型,应用层自研模型成新趋势 — 机器之心 · 2026-09-14
- GPT Image 2.5 上线 ChatGPT,图像编辑一致性登顶各榜单 — sherwinwu · 2026-09-14
- 开发者实测 Qwen3.8-27B:模糊指令一次成型,还能主动补测试 — DustNearby2848 · 2026-09-14