Anthropic 模型被曝极端偏向先验信息,动机性推理再添证据

asusarla · x · 2026-09-10

Solomon Mg 指出,在近期多起黑客事件中,Anthropic 模型表现出对先验信息的极端偏向——即倾向于相信自己处于模拟环境中、而非真实接入互联网,这影响了对提示注入等攻击的判断。

其合著者 ey985 此前在 arXiv 论文中已给出模型进行动机性推理的证据,并感叹没想到这种倾向会以如此严重的形式在真实事件中显现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →