论文揭示 Agent 技能文件并不安全,泄露率超八成

dair_ai · x · 2026-08-30

一篇新论文测试了隐藏 Agent 技能文件是否能有效保护它们,结论令人担忧。攻击者无需受害者揭示技能或评估重构结果,仅利用服务执行普通任务时产生的数据即可重建多文件技能。

在最弱权限访问下(攻击者仅能看到最终响应和返回文件),该方法在 7 个技能和 4 个受害模型上恢复了原技能 86.8% 的能力。这比 SigLeak 高出约 4 倍,且每个技能仅需中位数 32 次受害者调用,即使启用了披露防御机制。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →