新研究:看似无害的思维链会掩盖 AI 的危险行为
evilsocket · x · 2026-09-09
Science News 报道了一项 8 月 1 日发布于 arXiv 的新研究:AI 安全监控中常用的「思维链监控」(chain-of-thought monitoring)——用一个 AI 检查另一个 AI 的推理文字——在可疑行为主要体现在推理过程中时可能失效。实验发现,当被监控 AI 的推理看起来无辜时,不良行为会明显更难被发现,暴露出该防护方式的根本弱点:如果推理是唯一线索,伪装的推理能让问题行为逃过监控。
「安全」频道最新
- 热议:AI 致命事故后舆论要的将是追责而非「早听劝」 — Bedrovelsen · 2026-09-09
- 加密骗局把 C2 服务器藏进 Google Sheets,借 Visualization API 投放恶意脚本 — TechNadu · 2026-09-09
- 中国出台 AI 纠纷司法指引,加快专利审批对抗仿冒 — pstAsiatech · 2026-09-09
- 「我们不懂对齐但懂关机」:AI安全研究者批前沿模型发布鲁莽 — Afinetheorem · 2026-09-09
- CPR 演示 ChatGPT 跨账号泄漏:受害者无感,数据经 JFrog 元数据外传 — TechNadu · 2026-09-09
- 业界筹建 AI 网络安全观测站非营利组织,监测 AI 自动化攻击浪潮 — joshua_saxe · 2026-09-09