COLM 新论文:LLM 报告自身行为是否「心口一致」看层数分布

a_karvonen · x · 2026-10-06

新 COLM 论文《Identifying Introspection From the Inside》研究 LLM 告诉我们它的决策原因时,是真的「知道」驱动因素还是在猜。研究发现:行为忠实的模型在决策和报告时使用相同的层,而不忠实的模型则不然。作者指出 LLM 对早期层行为的自我报告明显更好——这与「早期层信息更可及」的直觉一致,DeepMind 研究者 akarvonen 认为这一发现合理且有趣。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →