COLM 论文:LLM 说的和想的一致吗?看它的内部层就知道
dhadfieldmenell · x · 2026-10-06
一篇将亮相 COLM 2026 的新论文《Identifying Introspection From the Inside》探讨:当 LLM 描述自己的决策时,它是真的「知道」驱动选择的因素,还是在猜测?
研究发现:在实验设定下,忠实(faithful)的模型做出决策与报告决策使用的是相同的网络层;而不忠实的模型则不然。这提供了一种从内部结构判断模型自省是否可信的方法。作者将在 COLM 2026 Poster Session 1(11am-1pm,Imperial Ballroom,#66)展示该工作。
所属事件:Bau实验室首次观测LLM忠实内省神经足迹(6 条相关)→
「研究」频道最新
- hardmaru 神经进化教科书正式出版,提供免费在线版 — burny_tech · 2026-10-07
- Flow-GRPO 接入真人投票打分,防图像模型钻奖励模型空子 — lmoroney · 2026-10-07
- 研究发现混合架构 LLM 过度依赖注意力,激发循环记忆问答提升 4.6% — EliasEskin · 2026-10-07
- ARC Prize 资源页改版:新增缩略图、标签页与搜索 — mhmazur · 2026-10-07
- Sentdex 实测:决策语言模型在机器人任务中尚难替代专用方案 — Sentdex · 2026-10-07
- 让 AI 当 Area Chair:给 ICML 全部 6617 篇论文排名,与人类选择严重分歧 — ShayneRedford · 2026-10-07