XConf 用模型自身经验估计置信度,AUROC 胜过十次采样自洽性

CambUni · hf · 2026-09-17

现有置信度估计方法只读当前推理过程(自省、token 概率或重采样)。上海AI Lab 等提出的 XConf 主张:置信度应结合模型积累的历史经验。

方法无需 logit 访问或权重更新,只增加一次生成。在覆盖推理、编码、多模态 QA 和交互 agent 的 9 个基准、4 个模型上,XConf 在 24 组对比中的 23 组判别力(AUROC)达到或超过十样本自洽性,ECE 校准误差低得多,生成成本仅十分之一。用于选择性预测时,放弃置信度最低的 10% 样本可使 agent 任务成功率提升最高 8.7 个百分点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →