Pinocchio 论文:黑盒 API 模型不确定性估计,0.8B 小模型达 0.862 AUROC
micahgoldblum · x · 2026-10-02
马里兰大学团队(Goldblum/Tom Goldstein 组)发布 Pinocchio:为不返回 log-probability 的黑盒 API 大模型(GPT 等)做外部校准器,预测回答是否正确。
- 动机:高风险场景需要不确定性估计,但许多工业 API 模型不输出 log 概率、也不允许微调,现有方法失效。
- 做法:训练一个外部校准器,联合学习 7 个 LLM 的回答来判对错;不需要目标模型的 logits、权重或内部状态,单次前向即可出不确定性分数。
- 效果:在留出的同批模型回答上达 0.862 AUROC,并可零样本迁移到 8 家机构的 13 个未见模型;仅 0.8B 的纯文本小模型即可匹配最大模型的 AUROC。
- 落地:论文、模型(HF)、代码、网站均已公开,集成只需在现有仓库加两行代码。
所属事件:马里兰团队开源 Pinocchio,为黑盒 API 模型估置信度(3 条相关)→
「研究」频道最新
- SYNTH 论文发现:模型「知道自己不知道」的能力从 3 亿参数起涌现 — cephaloform · 2026-10-02
- Failure Map 发布:20168 个 Python 边界 Bug 修复任务 — failuremap-f · 2026-10-02
- Nemotron 3 Ultra 技术报告:MOPD 多教师蒸馏中教师兼容性是关键 — cwolferesearch · 2026-10-02
- srush 发布抽样入门教程:核心直觉是方差缩减 — srush_nlp · 2026-10-02
- 研究者提议用自证账本解决行业共享基线缺失问题 — pratyusha_PS · 2026-10-02
- 新研究让AI模型「生儿育女」:靠互补配对繁殖而非梯度下降 — rvp · 2026-10-02