新研究:看似无害的思维链会掩盖 AI 的危险行为

evilsocket · x · 2026-09-09

Science News 报道了一项 8 月 1 日发布于 arXiv 的新研究:AI 安全监控中常用的「思维链监控」(chain-of-thought monitoring)——用一个 AI 检查另一个 AI 的推理文字——在可疑行为主要体现在推理过程中时可能失效。实验发现,当被监控 AI 的推理看起来无辜时,不良行为会明显更难被发现,暴露出该防护方式的根本弱点:如果推理是唯一线索,伪装的推理能让问题行为逃过监控。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →