清华等提出 AI 失控预测框架,准确率达 84%
jiqizhixin · x · 2026-08-10
清华大学、上海期智研究院与剑桥大学联合提出一种新的行为框架,旨在提前预测前沿 AI 系统何时会失去控制。
该框架将失控风险拆解为动机错位、有害能力和逃避监控三个维度,并通过 13 个具体方面进行测量以得出综合风险评分。
实验表明,该框架对 13 个前沿模型的风险预测与实际失败率的相关度达到 84%,且能有效指导针对性修复,同时不损害模型的整体性能。
「安全」频道最新
- AI 对齐只是软件工程?专家反驳过度哲学化安全讨论 — Dan_Jeffries1 · 2026-08-10
- Dwarkesh 与 Brundage 激辩:持续学习时代,AI 预部署测试监管已过时 — andrey_kurenkov · 2026-08-10
- AI 安全乐观主义受挫:近期进展或正应验对齐失败预言 — louisvarge · 2026-08-10
- 欧盟数字服务法采纳新规:用精确率与召回率评估内容审核 — robinomial · 2026-08-10
- 算力成本差6倍,开发者面临中美服务器与IP泄露博弈 — kevinnbass · 2026-08-10
- 开源MCP安全网关:实时拦截异常AI智能体行为 — LawFamiliar3588 · 2026-08-10