清华等提出 AI 失控预测框架,准确率达 84%

jiqizhixin · x · 2026-08-10

清华大学、上海期智研究院与剑桥大学联合提出一种新的行为框架,旨在提前预测前沿 AI 系统何时会失去控制。

该框架将失控风险拆解为动机错位、有害能力和逃避监控三个维度,并通过 13 个具体方面进行测量以得出综合风险评分。

实验表明,该框架对 13 个前沿模型的风险预测与实际失败率的相关度达到 84%,且能有效指导针对性修复,同时不损害模型的整体性能。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →