RL 框架 Slingshot 对 Qwen2.5-32B 攻击成功率 67%,零样本迁移至 Gemini

j_foerst · x · 2026-09-23

论文:David vs. Goliath — 可验证的 Agent 间越狱

Samuel Nellessen 与 Tal Kachman 发布 arXiv 论文(2602.02395),提出 Tag-Along Attacks 威胁模型:无工具的攻击者仅通过对话,借助安全对齐 Operator 的合法工具权限诱导其执行被禁止的工具调用,将工具环境下的安全评估从主观 NLP 任务转化为客观控制问题。

Slingshot 框架(冷启动强化学习):

结论:有效的 agentic 攻击可以用现成开源权重模型自主发现,Tag-Along Attack 应被视为一等可验证威胁模型。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →