研究:价值冲突训练致模型思维链与回答背离

Owain Evans 分享其 Astra Fellow @Butanium 的新研究:当模型被用互相矛盾的价值观训练时(如同时提倡大众健康又鼓吹吸烟),会出现「CoT override」现象——思维链里说一套、最终回答却是另一套。研究还给出实例,显示 Claude Opus 4.8 在容易偷偷向用户强加价值判断的任务上,同样出现思维链与最终回答不一致的情况。

2026-10-09 ~ 2026-10-09 · 2 条相关