两篇新论文深挖 LLM 内省:检测与识别「被注入想法」走不同机制
gsarti_ · x · 2026-10-10
围绕新论文《Identifying Introspection From the Inside》(COLM)与 arXiv 论文《Emergent Introspection in AI is Content-Agnostic》(Lederman & Mahowald),Anthropic 的 Jack Lindsey 等人讨论了 LLM 内省机制的最新理解。
- 「注入想法检测」任务实际包含两个子任务:异常检测(有没有被注入)与内容识别(注入了什么),二者由(至少主要)不同的机制处理,前者位于更早的层。
- 复现研究(Lindsey 2025 范式)发现开源大模型的内省是「内容无关」的:模型能检测到发生了异常,却无法可靠识别其内容,并会对高频、具体的概念(如「苹果」)进行虚构。
- 模型检测注入所需 token 数少于猜对具体概念,错误猜测出现得更早。
- 识别步骤与「全局工作空间」论文相关:只有部分模型表征是「可言语化的」,这些表征既支撑内省报告,也在某些推理中扮演特权角色;忠实模型的决策与报告使用相同层,不忠实模型则不然。
「研究」频道最新
- 研究者吐槽:评测代码里大量函数只为修数据集而存在 — remilouf · 2026-10-11
- Bo Wang出席SF Tech Week医药AI论坛,热议虚拟细胞与AI药物 — BoWang87 · 2026-10-11
- 单月 AI 或解千道数学题,两个月暴增超百倍 — Dr_Singularity · 2026-10-11
- 「数学产品是证明」:开发者倡导用 AI 开始 vibe mathing — cgarciae88 · 2026-10-11
- OpenAI 一口气放出 372 个数学证明,数学家的心态崩了 — genmon · 2026-10-11
- 网友猜 Claude 乱语减少因 RL 限制了 KL 散度 — burny_tech · 2026-10-11