研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储

机制可解释性研究者 Sauers 于 10 月 9 日发布线程并开源实验仓库 retained-reply-state,系统研究 LLM 的内省(introspection)能力:模型能以高于随机的概率「自省」找回从其过往思维链(CoT)中被删除的词元,说明信息仍残留在可见回复的缓存状态(KV cache)中,后续轮次可以读到它。这一发现值得关注,因为它直接触及模型「内心状态」是否可被自身及外部审计读取的问题。

已确认

尚未确认

为什么重要

2026-10-09 ~ 2026-10-09 · 6 条相关

一手来源