前沿模型已能识破 AI 控制干预,Astra 几乎饱和 CIAware 基准
maksym_andr · x · 2026-10-06
AI Control 研究者更新 CIAware-Bench(测试模型能否察觉自己被监控/干预的基准)后发现:
- 5 月首发时多数模型仅略高于随机水平,如今前沿模型出现阶跃式提升
- GPT-6 Astra 基本饱和该基准,几乎总能判断出自己的轨迹是否被篡改
- 在保留历史推理内容的真实部署中,DtT 或 TE 协议变得极易暴露,因为干预步骤会省略推理,这本身就泄露了监控者的信息
作者主张:今后设计控制协议时应默认假设模型具备完美的干预感知能力,这对 AI Control 协议的有效性构成重大挑战。
「安全」频道最新
- IIT 马德拉斯将办 AI 治理峰会,主题为 AI 测量与治理 — ravi_iitm · 2026-10-06
- 加载新模型前你查 auto_map 吗?选模型也能触发代码执行 — iamjessew · 2026-10-06
- Atlassian 披露 9.3 分高危漏洞,无需认证即可访问文件 — TechNadu · 2026-10-06
- 404 Media 报道促多党立法,拟全面限制联邦机构使用 Flock 摄像头 — 404 Media · 2026-10-06
- Anaconda 发布 agent swarm 编排与自主红队测试新能力 — anacondainc · 2026-10-06
- 开发者贴入「账户被黑」调查报告,反遭 OpenAI 威胁封号 — lucasmeijer · 2026-10-06