新研究首次诱导并观测LLM忠实内省的神经足迹
David Bau 介绍其实验室 diatkinson 基于 dillonplunkett 的 Self-Interpretability 协议开展的新实验,首次诱导并观测到大语言模型「忠实内省」的神经足迹。相关 COLM 新论文《Identifying Introspection From the Inside》研究了 LLM 报告自身决策原因时究竟是真的知道驱动因素还是在猜测,发现其是否「心口一致」与层数分布有关。Bau 称「对比内省」实验设置是出色的实验平台,揭示了 LLM 为何如此有效,并暗示了一条潜在的谎言检测路径。
2026-10-06 ~ 2026-10-06 · 3 条相关
- COLM 新论文:LLM 报告自身行为是否「心口一致」看层数分布 — a_karvonen · 2026-10-06
- 实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹 — davidbau · 2026-10-06
- 对比内省实验揭示 LLM 自述机制,读神经元或可测谎 — davidbau · 2026-10-06