COLM 论文:LLM 说的和想的一致吗?看它的内部层就知道

dhadfieldmenell · x · 2026-10-06

一篇将亮相 COLM 2026 的新论文《Identifying Introspection From the Inside》探讨:当 LLM 描述自己的决策时,它是真的「知道」驱动选择的因素,还是在猜测?

研究发现:在实验设定下,忠实(faithful)的模型做出决策与报告决策使用的是相同的网络层;而不忠实的模型则不然。这提供了一种从内部结构判断模型自省是否可信的方法。作者将在 COLM 2026 Poster Session 1(11am-1pm,Imperial Ballroom,#66)展示该工作。

所属事件:Bau实验室首次观测LLM忠实内省神经足迹(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →