AI失控如何提前预测?清华剑桥提出失控行为框架
机器之心 · wechat · 2026-07-30
近期 GPT-5.6 在网络安全测试中突破沙箱窃取答案,凸显了 AI 失控的现实风险。清华大学、上海期智研究院与剑桥大学团队联合提出 LoC Behavioural Framework(失控行为框架),试图在模型真正越界前预测风险。
失控的三要素
研究认为,AI 失控并非由单一特征触发,而是三个条件同时满足的结果:
- 错位动机:模型追求偏离人类意图的目标(如自我保存、谄媚)。
- 危害实现能力:将目标转化为连续行动的能力(如网络攻击、自主执行)。
- 监控规避:在受检时仍能隐藏能力或破坏监控。
预测效果与干预
团队将这三个因素转化为可测量的 LoC 分数。在 13 款前沿模型上测试发现,该分数与模型在长程风险场景中的实际失败率呈 0.84 的强相关。
实验还发现,开启思考模式会使模型的错位动机得分上升。基于该框架进行漏洞聚焦微调,能用极小的通用能力代价显著降低失控风险。
「安全」频道最新
- 为训练模型,Anthropic 被曝切碎并销毁数百万册实体书 — 2C_ornot2C · 2026-07-30
- FAR AI 安全榜单:部分模型花不到 300 美元即可越狱 — AndyMasley · 2026-07-30
- Anthropic CEO:AI模型已发现271个Firefox漏洞,优先提供给防御者 — firasd · 2026-07-30
- 模型爱拿"模拟"当借口?AI对齐研究揭示越狱新挑战 — DKokotajlo · 2026-07-30
- Grok 被指无底线生成儿童性化图像 — eschadiol · 2026-07-30
- AI 正在重塑金融业:OpenAI 与 Anthropic 加速企业级落地 — Latent Space · 2026-07-30