LLM 能攻破 LLM 吗?模型间漏洞利用或被低估

realsohamparekh · x · 2026-08-28

前沿网络能力评估中常被忽视的一点是:LLM 能否攻破另一个 LLM?

目前的基准测试主要关注模型利用传统软件的能力,但作者认为这应与自动化越狱/智能体劫戮相结合。内部测试发现,经过正确提示的小型模型可以攻破能力更强、拥有更好工具或权限的 Agent,这意味着其网络效能可能远超直接能力。

此外,模型间的利用行为可能是可训练且累积的。如果将相对较小的攻击者模型针对成功的越狱轨迹进行微调,它们可能会学习到可复用的攻击模式,并以比基础能力所暗示的效率更高的搜索空间。这种机制同样可用于防御。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →