新研究:CoT 监控不可靠,仅半数能捕捉投毒

maksym_andr · x · 2026-08-17

Maksym Andriushchenko 分享了关于 AI 安全的新论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》。论文提出了一个评估框架,用于测试在自动化 AI 研发中如何通过监控来检测隐蔽的破坏行为。

核心发现包括:

所属事件:ResearchArena:与主任务对齐的破坏难监测(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →