新实验:LLM 能读出已删 CoT 的隐藏信息,瓶颈在引出而非存储
Sauers_ · x · 2026-10-09
Sauers 发布开源实验仓库 retained-reply-state,在 Qwen3 模型上研究一个微妙问题:可见回复的缓存状态(KV cache)是否携带了隐藏思考中做出的选择,后续轮次能否读到它。
- 结论:LLM 对上下文中「本已不在但曾在」的 token 信息有一定读取能力
- 模型之所以不擅长这类内省,瓶颈在信息的引出(elicitation)而非存储——用线性探针就能以高准确率读出
- 机制上,模型通过把过去 CoT token 的信息复制进后续表征的电路完成这一任务
- 仓库包含注意力头定位、探针、消融等完整实验代码
所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→
「研究」频道最新
- COLM 2026 首届 Agent Behavior 研讨会 10 月 9 日旧金山举行 — _Hao_Zhu · 2026-10-09
- Autorubric 附 25 个评测配方:rubric 设计、judge 校准与成本控制全 covered — deliprao · 2026-10-09
- Autorubric 登场 COLM 2026:统一框架解决不可验证任务的 LLM 评测 — deliprao · 2026-10-09
- Google AMIE 登上柳叶刀:首个真实诊所前瞻性研究发布 — ymatias · 2026-10-09
- µ0 世界模型开源数据引擎 TraceExtract:纯视频训练机器人策略 — RexDouglass · 2026-10-09
- 仅 500 个 SWE 任务微调,AfterQuery 让 Qwen 27B 提升 11.3 分 — ycombinator · 2026-10-09