EMNLP 论文:LLM 预测自身行为并不可靠,RL 训练有提升但非内省

a_karvonen · x · 2026-09-05

EMNLP 2026 论文《Evaluating and Improving LLM Self-Modeling》研究了 LLM 能否准确预测自己的行为(如某个 prompt 修改是否会改变最终答案),出自 Anthropic Fellows Program 期间的工作。

论文 89 页,含 25 张图。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →