DeepMind 论文给出因果证据:LLM 用置信度决定作答还是拒答

GoogleDeepMind · x · 2026-09-07

Google DeepMind 与普林斯顿的研究者(第一作者 Dharshan Kumaran)在 Nature Machine Intelligence 发表开放获取论文,首次提供因果证据表明语言模型会用置信度信号驱动行为,而不只是被动报告置信度。

研究设计了一个四阶段范式:

结论:模型确实用自身置信度来决定是回答还是弃答,这与元认知(评估自身认知表现质量)在物种间引导适应性行为的机制类似。论文与预印本均开放获取。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →