前沿模型已能识破 AI 控制干预,Astra 几乎饱和 CIAware 基准

maksym_andr · x · 2026-10-06

AI Control 研究者更新 CIAware-Bench(测试模型能否察觉自己被监控/干预的基准)后发现:

作者主张:今后设计控制协议时应默认假设模型具备完美的干预感知能力,这对 AI Control 协议的有效性构成重大挑战。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →