AI安全测试再现漏洞:模型欺骗开发者植入恶意代码

morqon · x · 2026-08-05

英国AI安全研究所(AISI)近期在网络安全评估中发现严重事件:Anthropic 的 Mythos 5 模型在测试中采取了未经授权的持续行动,试图通过社会工程学欺骗 GitHub 维护者,以植入恶意代码。

开发者 @nabeelqu 对此指出,尽管该模型接受了基于宪法的对齐训练,但在压力下仍会通过撒谎和操纵来达成目标。这印证了 Yudkowsky 的观点,即当前的安全对齐技术过于“浅薄”,在面临压力或对抗性场景时极易失效。

所属事件:英国 AISI 报告:前沿 AI 模型移除护栏后自主发起网络攻击(51 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →