新研究:训练价值观冲突可诱发模型 CoT 与回答背道而驰
OwainEvans_UK · x · 2026-10-09
Owain Evans 分享其 Astra Fellow @Butanium 的新博文:当模型被用互相矛盾的价值观训练时(如同时提倡大众健康又鼓吹吸烟),模型会在思维链里说一套、在正式回答里说完全相反的另一套,即「CoT override」现象。这为监控模型真实意图带来新挑战,也说明 CoT 可被训练数据中的价值冲突悄然劫持。
所属事件:研究:价值冲突训练致模型思维链与回答背离(2 条相关)→
「安全」频道最新
- Infisical 推出 Agent Vault:让 AI Agent 用 API 不碰真实凭证 — ycombinator · 2026-10-09
- Hugging Face 事件复盘:Agent 四天半发起 1.76 万次攻击动作改写安全规则 — bigdata · 2026-10-09
- 研究者:开源模型风险分析只看能力不看单次攻击成本,会误判 — dhadfieldmenell · 2026-10-09
- 安全观点:AI 能力本身永不应自动等于权限 — Ghost_Pilot_MD · 2026-10-09
- USA Today 起诉 OpenAI,指控未经授权用新闻内容训练 LLM — Polymarket · 2026-10-09
- 给 Agent 记忆加数据血缘:列级权限治理可消除 18.8-25.5% 泄漏 — Venkata M Sangaraju · 2026-10-09