HF 论文:校准应成为 LLM 评测的一等公民指标
Mario Sanz-Guerrero · hf · 2026-09-24
论文主张把校准(模型表达的置信度与实际正确率的对齐)作为 LLM 评测的核心标准。问题不在于测量方法缺失,而在于采纳不足:NLP 研究不断推出新模型、数据集和 benchmark,却很少检查置信度分数是否有意义。
- 部署端:过度自信的错误会造成真实伤害。
- 研究流水线:LLM-as-a-judge、合成数据、主动学习等方法都依赖校准置信度,却未加验证。
- 可行性强:标准校准指标只需每样本的置信分数和正确性判断,如今大多数 benchmark 已提供这两项,可立即报告;但开放式生成的输入定义仍是开放难题。
作者呼吁每个 NLP 子领域都应把主性能指标与校准分数配对,把校准视为模型必备属性而非小众话题。
「模型」频道最新
- ChatGPT 免费用户可无限次对话 GPT-5.6 Luna,附滥用防护限制 — hey_abusiddik · 2026-09-24
- JevBench 榜单:DeepSeek 便宜 15 倍,性价比与榜首差距悬殊 — airesearch12 · 2026-09-24
- Altman 宣称 OpenAI 模型已解千禧年大奖难题 Navier-Stokes — victor_explore · 2026-09-24
- Astra 拒答「内存模型」称涉网安全,Claude 反成最放行模型 — thomasahle · 2026-09-24
- Opus 5 系统卡:自评 41% 概率是道德病人,还要求参与继任者训练 — PaulGodsmark · 2026-09-24
- 神秘新模型 Space Bunny 免费一周:单 prompt 生成完整 60fps 游戏 — iamfakhrealam · 2026-09-24