HF 论文:校准应成为 LLM 评测的一等公民指标

Mario Sanz-Guerrero · hf · 2026-09-24

论文主张把校准(模型表达的置信度与实际正确率的对齐)作为 LLM 评测的核心标准。问题不在于测量方法缺失,而在于采纳不足:NLP 研究不断推出新模型、数据集和 benchmark,却很少检查置信度分数是否有意义。

作者呼吁每个 NLP 子领域都应把主性能指标与校准分数配对,把校准视为模型必备属性而非小众话题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →