DeepMind 论文给出因果证据:LLM 用置信度决定作答还是拒答
GoogleDeepMind · x · 2026-09-07
Google DeepMind 与普林斯顿的研究者(第一作者 Dharshan Kumaran)在 Nature Machine Intelligence 发表开放获取论文,首次提供因果证据表明语言模型会用置信度信号驱动行为,而不只是被动报告置信度。
研究设计了一个四阶段范式:
- 第一阶段:在不提供弃答选项时引出基线置信度;
- 第二阶段:发现 LLM 弃答时对内部置信度施加隐式阈值,置信度的效应量比其他机制大约高一个数量级;
- 第三阶段:通过激活转向(activation steering)提供因果证据——提升置信度减少弃答、抑制置信度增加弃答,中介分析确认置信度是因果通路;
- 第四阶段进一步验证该机制。
结论:模型确实用自身置信度来决定是回答还是弃答,这与元认知(评估自身认知表现质量)在物种间引导适应性行为的机制类似。论文与预印本均开放获取。
「模型」频道最新
- 合成数据已成训练主流:小模型训练本质是蒸馏 — RexDouglass · 2026-09-07
- Sol High 用量实测:复杂写作项目一次吃掉 5 小时限额的 5% — remixedmoon5 · 2026-09-07
- 印度非营利组织 Bodhan AI 开源全套印度语言语音视觉翻译模型 — selfawareatom · 2026-09-07
- Claude Max 用户称用量限制连续一周出现乱跳 bug — tonimedic · 2026-09-07
- 开发者提醒:Astra 擅长可展示的领域,但 AGI 关键在系统级理解 — Scobleizer · 2026-09-07
- 腾讯开源 EVIE 视觉文档检索模型,ViDoRe V3 达 66.75 — jacek2023 · 2026-09-07