研究:LLM 能读取已截断上下文信息,瓶颈在引导而非存储
Sauers_ · x · 2026-10-09
Sauers 总结其关于 LLM 内省(introspection)的研究发现:模型其实能访问那些"曾经在但现已不在"上下文中的信息——例如已从上下文截断、但仍留在历史思维链 token 中的内容。
- 关键结论:LLM 做不好这类内省,瓶颈在于信息的引导(elicitation)而非存储;用线性探针(linear probe)就能以高准确率把信息读出来。
- 机制:模型依赖特定电路把过去 CoT token 的信息复制进响应 token,从而在下一轮回复中被访问。
- 他还发现同一个"抑制内省"的注意力头同时介导了 Janus / CPU document 效应,提示两类现象共享底层机制。
所属事件:实验显示 LLM 可读取已删思维链信息,瓶颈在引出(2 条相关)→
「研究」频道最新
- 自动驾驶一线经验沉淀:半监督学习“炼金术”长文 — Visual_Ability · 2026-10-09
- RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍 — thoma_gu · 2026-10-09
- 有人辟谣:AI并未解决千禧年难题Navier-Stokes,Lean证明偷换概念 — gerardsans · 2026-10-09
- 新开源基准3JSBench:前沿模型能解千禧难题却建不好3D物体 — ycombinator · 2026-10-09
- Moonworks 发布 Lunara:扩散混合 Transformer 主打艺术审美,人类盲评全场最高 — paper-crow · 2026-10-09
- 实测 ChatGPT 与 Gemini 引用偏好:巴西本地域名占比达 41.4% — gaganghotra_ · 2026-10-09