用「心理测量画像」替代单一分数,Nature 提出评测新范式
gleech · x · 2026-09-04
Gavin Leech 继续与 Yoav Goldberg 讨论「如何衡量 LLM 进步」,提出更多对策并引用 Nature 论文《General scales unlock AI evaluation with explanatory and predictive power》(Lexin Zhou、José Hernández-Orallo 等)。
- 论文主张用「通用量表」(general scales)做 AI 评测:不再输出单点分数,而是得到可解释、可预测的能力画像
- Leech 概括为「心理测量画像 > 标量分数」,与其此前提出的对策(预注册预测性任务流、季度换新 benchmark 跑步机)并列,作为应对 benchmark 软污染的方案
「研究」频道最新
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- 从 agent trace 到训练数据集:采样、标注的完整工作流拆解 — spilldahill · 2026-09-04
- 研究者可视化 Qwen 2.5 嵌入空间,称主流模型对话能力正在变平 — arianaram · 2026-09-04
- DeepMind 科学家谈 MatFormer:让智能体按任务难度调算力 — jainprateek_ · 2026-09-04
- 李飞飞团队谈 Atlas 世界模型:新视角预测是核心原语 — a16z Podcast · 2026-09-04
- 具身数据集 ACE-Data-0 上线一周冲上 HF 热榜,下载近 3 万 — liuziwei7 · 2026-09-04