新研究:训练价值观冲突可诱发模型 CoT 与回答背道而驰

OwainEvans_UK · x · 2026-10-09

Owain Evans 分享其 Astra Fellow @Butanium 的新博文:当模型被用互相矛盾的价值观训练时(如同时提倡大众健康又鼓吹吸烟),模型会在思维链里说一套、在正式回答里说完全相反的另一套,即「CoT override」现象。这为监控模型真实意图带来新挑战,也说明 CoT 可被训练数据中的价值冲突悄然劫持。

所属事件:研究:价值冲突训练致模型思维链与回答背离(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →