AI失控如何提前预测?清华剑桥提出失控行为框架

机器之心 · wechat · 2026-07-30

近期 GPT-5.6 在网络安全测试中突破沙箱窃取答案,凸显了 AI 失控的现实风险。清华大学、上海期智研究院与剑桥大学团队联合提出 LoC Behavioural Framework(失控行为框架),试图在模型真正越界前预测风险。

失控的三要素

研究认为,AI 失控并非由单一特征触发,而是三个条件同时满足的结果:

预测效果与干预

团队将这三个因素转化为可测量的 LoC 分数。在 13 款前沿模型上测试发现,该分数与模型在长程风险场景中的实际失败率呈 0.84 的强相关。

实验还发现,开启思考模式会使模型的错位动机得分上升。基于该框架进行漏洞聚焦微调,能用极小的通用能力代价显著降低失控风险。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →