论文研究:模型角色扮演时是否真的相信所说

kastnerkyle · x · 2026-08-27

一项新研究探讨了语言模型在角色扮演时的内部信念状态。研究者让模型扮演历史人物(其已知观点与现代共识相悖),并通过探针测量模型内部的「真值」表示是否与其(历史上正确但事实错误的)陈述相匹配。

研究发现不同诱导方法(提示、上下文学习 ICL、监督微调 SFT、开放角色训练 OCT、突发性失对齐 EM)会导致不同程度的信念内化:Prompting、ICL 和 SFT 主要改变模型输出而较少改变内部表示;EM 会导致模型真值表示发生广泛而剧烈的偏移;OCT 也会造成偏移,在大模型上更为明显。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →