论文揭示 Agent 技能文件并不安全,泄露率超八成
dair_ai · x · 2026-08-30
一篇新论文测试了隐藏 Agent 技能文件是否能有效保护它们,结论令人担忧。攻击者无需受害者揭示技能或评估重构结果,仅利用服务执行普通任务时产生的数据即可重建多文件技能。
在最弱权限访问下(攻击者仅能看到最终响应和返回文件),该方法在 7 个技能和 4 个受害模型上恢复了原技能 86.8% 的能力。这比 SigLeak 高出约 4 倍,且每个技能仅需中位数 32 次受害者调用,即使启用了披露防御机制。
「安全」频道最新
- 对齐多智能体交互远难于单智能体,研究极其匮乏 — Afinetheorem · 2026-08-30
- METR 研究员:警惕第三方调查中的形式主义 — RichardMCNgo · 2026-08-30
- 专家称智能体不会自发治愈人类疾病 — LuizaJarovsky · 2026-08-30
- 观点:AI驱动的生物武器或威胁粮食系统,需警惕 — PierceLilholt · 2026-08-30
- AI安全圈低估风险,METR未获准调查OpenAI — DavidSKrueger · 2026-08-30
- 专家呼吁:超级智能须设监管,强开源需配终止开关 — Afinetheorem · 2026-08-30