EMNLP 论文:推理模型更强但置信度未必更可靠
zhaoran_wang · x · 2026-09-29
SteveZeng7 团队围绕「如何让模型置信度值得信任」分享系列研究,王昭然转发:
- 两篇 EMNLP 2025 论文:分别评测推理模型与视觉语言模型(VLM)的校准性,发现能力更强并不自动带来更可靠的置信度,任务类型和模态都有影响。
- ACL 2026 工作:把校准带进 agentic RL,在工具使用智能体中显式地与任务表现一起优化校准(《The Confidence Dichotomy》)。
- 作者认为 Jev/RLCD 把校准带入聚光灯,当置信度开始驱动真实行动时,校准将成为需要训练和评估的核心能力。
「研究」频道最新
- 30 多实验室复现失败:Marcus 1999 年 16 名婴儿的经典研究遭挑战 — tallinzen · 2026-09-29
- NLP 传奇 Chris Manning 播客:语言模型先学动词类别再学单个动词 — ziv_ravid · 2026-09-29
- 统计学者互怼:什么样的贝叶斯更新规则才算合格 — RexDouglass · 2026-09-29
- Google 发布多智能体 AI 视频联合导演框架,解决长视频一致性难题 — rseroter · 2026-09-29
- Google 实习成果 BLUE 入选 NeurIPS,用 LLM 画像提升推荐效果 — shangbinfeng · 2026-09-29
- 数学家 Kontorovich 剖析 Collatz 论证盲区:同样适用于 3x-1,难以区分轨道根 — AlexKontorovich · 2026-09-29