研究:黑盒交互可窃取Agent技能,平均恢复率达48%

rohanpaul_ai · x · 2026-08-17

一项新研究测试了通过黑盒交互窃取专有SKILL.md的可能性。在5个商业模型上,最简单的提取提示平均精确恢复率达48%,LLM判定泄漏比率为0.91。更结构化的攻击(如思维链提示)将精确恢复率提升至72%。阻止逐字复制不够,翻译和改写攻击可使精确匹配降至0%但保留大部分语义。作者的最强防御能阻止精确泄露,但语义泄漏仍存在。研究建议平台应将技能内容视为可通过模型行为外泄的数据。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →