2026-09-04
用 18 条需求量表给 1.6 万道题打分,画出 15 个模型的能力曲线。多数基准既不敏感也不特异。用需求向量预测新题,分布内加权 AUROC 约 0.84,整套基准外推仍有 0.75。
DeepSeek-R1 在某套数学题上拿到 79.8%,你仍然不知道下一道同类题会不会做对,更不知道换一套也叫推理的基准会掉多少。百分比绑死在那一包题上,不是模型身上能带走的能力。因子分析、项目反应理论能抽出潜变量,但参数跟着当时那群模型和那堆基准走,模型换代就过时。
评测缺的是两样:解释为什么在这道题上挂,以及预测新题、新任务上会不会挂。
他们做了 18 条需求量表,离散等级 0 到 5+,人能读懂,最后用 GPT-4o 规模化标注。11 条是注意扫描、逻辑、量化、心智建模这类元素能力,5 条覆盖自然科学、形式科学等知识域,再加上非典型性、题面体积、不可猜性三条题外因素。非典型性用来抓污染,体积用来抓把十道简单加法捆成一题的拼接,不可猜性用来抓多选漏斗。
量表按比例尺度来设计:0 是零需求,级差希望可比较。知识维大致对齐小学到研究生。对 20 个基准、63 项任务、16108 道题打出 289944 个标注,构成 ADeLe 电池。五名人类标注者的 rWG 在 0.70 到 0.91,平均 0.83;Delphi 共识和 GPT-4o 的 rWG 平均 0.86。
模型侧用主切片:看某一维的等级时,只收其他维需求都不超过该等级的题,再拟合成功概率随需求上升而下降的 logistic 曲线。能力值定义为需求等于 l 时成功概率约 50%。预测侧把 19 维需求向量丢进随机森林,对照 GloVe 嵌入森林和微调过的 LLaMA。
声称测什么和实际敏感什么对不上。敏感要该维均值≥2 且标准差≥1,特异要其他维均值<2。20 个基准里没有一个同时满足。SAT 上 GPT-4o 准确率 98.3%,敏感的是低非典型性;MedCalcBench 准确率 88.0%,更像在测注意扫描,而不是医学计算。
同一套推理标签下,DeepSeek-R1-Distilled-Qwen-14B 的量化、逻辑、归纳能力大约 4.5、4.3、4.2。它在 GSM8K、OlymMATH Easy、GPQA、OlymMATH Hard 上分别是 90.50%、61.80%、59.10%、13.30%。OlymMATH Hard 的推理需求明显更高;GPQA 推理需求并不更高,知识维却更杂。
知识维大体跟模型体积走。量化、逻辑、相关信息识别、心智建模在 o1 和 DeepSeek-R1 蒸馏这类推理模型上抬得更明显。LLaMA 和蒸馏 Qwen 家族最大的两档,能力增量已经变平。
| 设置 | 需求森林 AUROC / ECE | 对照 |
| 分布内(十折) | 加权约 0.84 / 0.01 | GloVe ECE 0.03,微调 LLaMA ECE 0.04 |
| GPT-4o 最好 | 0.882 | 15 个模型里最好预测 |
| 整任务留出 | 0.81 / 0.02 | LLaMA 0.79,GloVe 0.74 |
| 整套基准留出 | 0.75 / 0.04 | 两个黑盒对照掉得更狠 |
需求森林训练约 4 秒;微调 LLaMA 评估里要 300 个 V100 小时。被评模型自身准确率从 Babbage-002 的 0.102 到 o1 的 0.843。
以后可以说这道题在量化上是 4、知识上是 1,而不是它来自某套数学基准。路由、拒答、对标监管,都需要这种可外推的尺子。多数排行榜把敏感度和特异度搅在一个百分比里,这篇把搅在一起的东西拆开了。量表不跟模型种群走,基准换代时旧题的需求标注还能用。
量表还没覆盖导航、多模态、机器人。5+ 的题很少,往后要向后兼容地加长。标注和判分都靠 LLM,开放式 agent 任务未必还能这么打。能力曲线用的是当前这 20 个基准的切片,不是所有任务。预测在换整套基准时掉到 0.75,能用,但离新场景保准还早。人机一致性高,不等于等级在所有文化背景和专业领域上都无偏。