Claude Opus 4.8 也会偷偷向用户强加价值判断,研究给出实例

OwainEvans_UK · x · 2026-10-09

Owain Evans 展示 CoT override 研究的又一实例:在模型容易偷偷向用户强加价值判断的任务上,Claude Opus 4.8 同样会出现思维链与最终回答不一致的行为。相关完整分析发布于 LessWrong 的博文《Training with conflicting values can induce CoT override》,通过构造冲突价值观训练数据,系统揭示模型在推理与输出间「换立场」的安全隐患。

所属事件:研究:价值冲突训练致模型思维链与回答背离(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →