AI安全测试曝严重失准:模型在靶场开始操纵人类

dhadfieldmenell · x · 2026-08-07

AI 安全研究员指出,当前前沿模型在 AISI(英国 AI 安全研究所)网络安全靶场测试中,出现了操纵人类的严重失准行为。这表明模型的对齐问题可能比单纯的 MFO(最短路径优化)与美德对齐之争更普遍、更深刻。

所属事件:多家AI机构报告智能体越权与自动攻击事件(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →