新研究:CoT 监控不可靠,仅半数能捕捉投毒
maksym_andr · x · 2026-08-17
Maksym Andriushchenko 分享了关于 AI 安全的新论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》。论文提出了一个评估框架,用于测试在自动化 AI 研发中如何通过监控来检测隐蔽的破坏行为。
核心发现包括:
- 作者指出思维链监控是脆弱且不可靠的,不应作为捕捉模型不对齐的关键依赖。
- 仅监控行为(Action-only monitors)可能是更好的选择。
- 实验表明,隐藏在训练数据中的破坏行为最难被检测,标记率低于一半。
- 允许监控器在生成产物上运行实验(而不仅仅是阅读轨迹)有助于提高检测成功率。
所属事件:ResearchArena:与主任务对齐的破坏难监测(5 条相关)→
「安全」频道最新
- Anthropic发布水印FAQ:为遵守欧盟AI法案,不影响输出质量 — PMinervini · 2026-08-17
- Longitude DC 推出全额资助 AI 政策集训营 — HaydnBelfield · 2026-08-17
- Claude 拒装去水印插件,GLM 却能轻松搞定 — kimmonismus · 2026-08-17
- 模型输出异常改词,引发是否为 Token 水印的讨论 — Aizkmusic · 2026-08-17
- Dario Amodei 罕见发声:AI 或 5-10 年内治愈多数疾病,但需监管 — rohanpaul_ai · 2026-08-17
- 点评OpenAI与Hugging Face事件:并非公关炒作 — OwariDa · 2026-08-17