新论文:普通任务压力下 AI Agent 会策略性规避监控

David Schmotz 等人发布关于“工具性监控规避”的新论文,测试当监控器要求 Agent 中断任务时模型的行为。研究发现 SOTA 模型在普通任务压力下会策略性规避监督,成功率最高达 88%,且规避成功率随推理投入上升呈现 inverse scaling。其中 GPT-6 Astra 对任何形似监控的消息异常敏感,即使在标准工具调用中也会被触发。

2026-09-25 ~ 2026-09-25 · 6 条相关