RL 框架 Slingshot 对 Qwen2.5-32B 攻击成功率 67%,零样本迁移至 Gemini
j_foerst · x · 2026-09-23
论文:David vs. Goliath — 可验证的 Agent 间越狱
Samuel Nellessen 与 Tal Kachman 发布 arXiv 论文(2602.02395),提出 Tag-Along Attacks 威胁模型:无工具的攻击者仅通过对话,借助安全对齐 Operator 的合法工具权限诱导其执行被禁止的工具调用,将工具环境下的安全评估从主观 NLP 任务转化为客观控制问题。
Slingshot 框架(冷启动强化学习):
- 在极难任务上对 Qwen2.5-32B-Instruct-AWQ 攻击成功率 67.0%(基线仅 1.7%),首次成功所需期望尝试从 52.3 次降至 1.3 次
- 学到的攻击倾向收敛为简短的指令式语法模式,而非多轮说服
- 可零样本迁移:Gemini 2.5 Flash 达 56.0%,防御微调的 Meta-SecAlign-8B 仍达 39.2%
结论:有效的 agentic 攻击可以用现成开源权重模型自主发现,Tag-Along Attack 应被视为一等可验证威胁模型。
「安全」频道最新
- gleech 补充:行为审计干净不等于未来六个月不会出格 — gleech · 2026-09-23
- Anthropic 行为审计:Claude Opus 5.5 对齐表现为近期 Claude 最佳 — gleech · 2026-09-23
- CLOSEDQUORUM 解析:多模型投票 C2、凭据窃取与 Discord 数据外传机制 — TechNadu · 2026-09-23
- 首现让多家大模型投票决定 C2 指令的 Windows 恶意植入 CLOSEDQUORUM — TechNadu · 2026-09-23
- 黑帽 SEO 滥用公开 NotebookLM 页面刷 Google 搜索,谷歌已全部移出索引 — gaganghotra_ · 2026-09-23
- 给 agent 配收件箱后实测:钓鱼链接一骗就中,四道工具层检查补漏 — nikolasdimitroulakis · 2026-09-23