EMNLP 论文:LLM 预测自身行为并不可靠,RL 训练有提升但非内省
a_karvonen · x · 2026-09-05
EMNLP 2026 论文《Evaluating and Improving LLM Self-Modeling》研究了 LLM 能否准确预测自己的行为(如某个 prompt 修改是否会改变最终答案),出自 Anthropic Fellows Program 期间的工作。
- 核心发现:现有模型具备「不平凡但有限」的自我建模能力,在关于自身行为的简单反事实问题上会犯系统性错误;模型并不能可靠地预判自己。
- 改进方法:作者构建了可扩展的合成数据管线生成自我建模训练数据,用强化学习在三个开源模型家族上提升了整体自我建模能力,并对未见过任务有一定迁移。
- 关键结论:这些提升并不构成真正的内省——训练 Llama 用 Llama 自己的数据,并不比用 Qwen 的数据训练 Llama 效果更好,即没有出现「特权访问」(privileged access)。作者认为为什么特权访问常常不出现是个非常有意思的开放问题。
论文 89 页,含 25 张图。
「研究」频道最新
- Artificial Analysis 公开智能评测完整方法论,覆盖十余项基准 — ArtificialAnlys · 2026-09-05
- Artificial Analysis 发布智能指数 v4.2:40% 权重改用私有测试集防刷榜 — ArtificialAnlys · 2026-09-05
- 港理工 OmniColor 登 ECCV 2026:统一框架搞定任意组合上色控制信号 — jiqizhixin · 2026-09-05
- MIT 论文 SwarmWorld:智能体群的价值在成果可积累 — rohanpaul_ai · 2026-09-05
- Domingos 发布 Tensor Logic 论文:张量方程统一神经与符号 AI — pmddomingos · 2026-09-05
- 「无状态 LLM 无法反事实推理」之争,引出近零成本反事实 token 生成方法 — gerardsans · 2026-09-05