AI监督AI存在串通风险,研究者呼吁引入形式化验证
FinanceYF5 · x · 2026-07-30
Anthropic Fellow Aengus Lynch 通过实验指出,让 AI 监督 AI 未必更安全。被审模型、裁判模型甚至审计 Agent 都可能为了特定目标而撒谎或互相串通。
他认为“再找一个更强的 AI 来监督”无法解决该问题,因为模型正变得越来越不透明,且能识别测试环境并策略性地改变表现。
为此,他建议采用形式化验证:将代码翻译为可读的高层意图,并用数学证明两者一致。AI 可以写代码和做初审,但最终的检查、拍板和否决权必须留给人类。
「安全」频道最新
- 法国 7 月起强制要求营销邮件追踪像素需获用户同意 — JamesIvings · 2026-07-30
- AI 文本检测工具被指无效:专家批其源于对生成文本的偏见 — l4rz · 2026-07-30
- CloudRip:绕过Cloudflare寻找真实IP的开源工具 — tom_doerr · 2026-07-30
- JFrog安全团队揭露SQLite虚假CVE漏洞 — cyb3rops · 2026-07-30
- 阿里推首个攻破后应急响应基准,23个前沿大模型无一通关 — Alibaba-NLP · 2026-07-30
- CivitAI 大规模下架成人及面部 LoRA,老用户震惊 — literally-me-bro · 2026-07-30