实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹
davidbau · x · 2026-10-06
David Bau 介绍其实验室 @diatkinson 基于 @dillonplunkett 的 Self-Interpretability 协议(arXiv:2505.17120)开展的一系列实验,首次在开源模型上诱导并直接观测「内省」:
- 实验设置:训练 Qwen3-32B 扮演 100 个角色做 A/B 决策,每个角色有随机隐藏偏好(如 Gregor Samsa 买洗衣机偏好便宜但吵的机型),仅用 SFT 训练其输出决策。
- 决策能泛化,自述却是胡说:模型很快能在新「Gregor Samsa 洗衣机难题」上答对,但被问「我想的是 X」时输出的自我解释与实际学到的偏好无关——像随机鹦鹉。
- 关键突破:把训练延长 3 倍后,忠实自我报告突然涌现——step 1000 时决策 0.82/忠实度 0.25,step 3000 时决策 0.92/忠实度 0.83,形成天然对照组。忠实 checkpoint 将偏好存储在早 5-6 层的位置,假设是:只有偏好足够早、能被模型已有的语言化机制读取时,自我报告才有效。
- 可测的神经足迹:忠实模型决策与报告归因的余弦相似度为 0.34,不忠实模型仅 0.08(差值 95% CI 0.16–0.36),可从神经元读出差别。
结论:同一个模型既可能给出深刻准确的「我认为 X」,也可能随机鹦鹉式地撒谎;内省与泛化之间存在直接可测的神经联系。
「模型」频道最新
- 博主断言:合成数据是下一个大机会,编码行业正在结构性改变 — creatoroff · 2026-10-06
- 用户实测:Codex 空转刷 token,Claude Opus 理解力显著更强 — iruletheworldmo · 2026-10-06
- Cohere 发布 Tiny Aya 多语言小模型家族,支持 70 余种语言 — Cohere_Labs · 2026-10-06
- 0.8B 模型闭式权重手术跑赢 2B 模型,ARC-Challenge 达 42.15% 零反向传播 — AdventurousTwo6445 · 2026-10-06
- Mistral 新模型今日发布在即,Mensch 称部分领域超越中国模型 — uusrikas · 2026-10-06
- Mustafa Suleyman 曾称幻觉 2025 年基本消除,如今被群嘲 — PMinervini · 2026-10-06