COLM 新论文:LLM 报告自身行为是否「心口一致」看层数分布
a_karvonen · x · 2026-10-06
新 COLM 论文《Identifying Introspection From the Inside》研究 LLM 告诉我们它的决策原因时,是真的「知道」驱动因素还是在猜。研究发现:行为忠实的模型在决策和报告时使用相同的层,而不忠实的模型则不然。作者指出 LLM 对早期层行为的自我报告明显更好——这与「早期层信息更可及」的直觉一致,DeepMind 研究者 akarvonen 认为这一发现合理且有趣。
「研究」频道最新
- 新攻击 PLW:恶意厂商可借图像水印泄露你的聊天隐私 — chaumian · 2026-10-06
- APSP 次立方与 3SUM 次平方算法问世,细粒度复杂度格局生变 — thegautamkamath · 2026-10-06
- 亚马逊提出ALoDLM:按token难度自适应分配循环深度 — amazon · 2026-10-06
- CANOPY:多模态RAG证据压缩,token省近三成精度不掉 — POSTECH · 2026-10-06
- Kandinsky 6.0 Video开源:音视频同步生成,MIT协议放全权重 — kandinskylab · 2026-10-06
- RACE:让VLA机器人动作块延长4倍,停顿时间缩短约5倍 — POSTECH · 2026-10-06