模型能内省找回已删除的 CoT 词元,机制却出人意料

Sauers_ · x · 2026-10-09

作者发推引出一篇关于模型内省(introspection)的机制研究长线程:模型能在高于随机水平的程度上,通过内省恢复其过去思维链(CoT)中被删除的词元。线程探讨两个问题:这一能力在机制上如何实现?以及为什么某些模型在利用内省时,反而会降低(而非提高)在被问及时说出自己想到的那个词的概率?

所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →