模型能内省找回已删除的 CoT 词元,机制却出人意料
Sauers_ · x · 2026-10-09
作者发推引出一篇关于模型内省(introspection)的机制研究长线程:模型能在高于随机水平的程度上,通过内省恢复其过去思维链(CoT)中被删除的词元。线程探讨两个问题:这一能力在机制上如何实现?以及为什么某些模型在利用内省时,反而会降低(而非提高)在被问及时说出自己想到的那个词的概率?
所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→
「研究」频道最新
- Lancet 前瞻性研究:面向患者的 AI 问诊在急诊场景表现获认可 — EricTopol · 2026-10-09
- COLM 2026 首届 Agent Behavior 研讨会 10 月 9 日旧金山举行 — _Hao_Zhu · 2026-10-09
- Autorubric 附 25 个评测配方:rubric 设计、judge 校准与成本控制全 covered — deliprao · 2026-10-09
- Autorubric 登场 COLM 2026:统一框架解决不可验证任务的 LLM 评测 — deliprao · 2026-10-09
- Google AMIE 登上柳叶刀:首个真实诊所前瞻性研究发布 — ymatias · 2026-10-09
- µ0 世界模型开源数据引擎 TraceExtract:纯视频训练机器人策略 — RexDouglass · 2026-10-09