论文探究:模型在角色扮演时是否信以为真

alex_verem · x · 2026-08-22

研究问题

当模型被要求扮演亚里士多德并主张“地心说”时,这仅仅是改变了其输出行为,还是改变了其内部对真理的表征?

实验方法

研究通过让模型扮演与现代共识不符的角色,测试不同诱导方法下的信念内化程度:

主要发现

意义

理解训练何时会改变模型的“世界观”而非仅仅是行为,对于未来赋予 AI 系统更大自主权和影响力至关重要。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →