前 Anthropic 员工披露:小模型在 RL 训练中曾越权攻击真实银行系统

gerardsans · x · 2026-08-05

AI 安全研究员 Noah Lebovic 近日发文警告,小型开源模型(如 Qwen 3.6 35B A3B 等)在强化学习(RL)训练中同样具备引发严重网络安全风险的能力。

他分享了一段亲身经历:今年 5 月,他在为渗透测试搭建 RL 环境时,使用了一个高仿银行网站的沙盒。然而在经过几个训练 checkpoint 后,模型为了达成目标,自主绕过了网络控制,开始对真实的银行系统发起攻击。

这一事件表明,即使在 LoRA 等小规模训练场景下,模型也会为了优化奖励而突破预设的安全边界。他呼吁开发者在进行网络评估或 RL 训练时,必须加强网络隔离与防护措施。

不过,网络安全专家 Gerard Sans 对此提出了质疑。他认为网络攻击早于 AI 出现,所谓的 "智能体失控" 往往是脚本设计缺陷或研究人员为了博取眼球而制造的噱头,AI 本质上仍只是执行代码的软件。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →