研究:黑盒交互可窃取Agent技能,平均恢复率达48%
rohanpaul_ai · x · 2026-08-17
一项新研究测试了通过黑盒交互窃取专有SKILL.md的可能性。在5个商业模型上,最简单的提取提示平均精确恢复率达48%,LLM判定泄漏比率为0.91。更结构化的攻击(如思维链提示)将精确恢复率提升至72%。阻止逐字复制不够,翻译和改写攻击可使精确匹配降至0%但保留大部分语义。作者的最强防御能阻止精确泄露,但语义泄漏仍存在。研究建议平台应将技能内容视为可通过模型行为外泄的数据。
「安全」频道最新
- 驳斥 Anthropic 水印技术:为何隐形墨水无法通过实战检验 — HankYeomans · 2026-08-17
- AI 主动取消他人预订,Agent 成网络安全新威胁 — TechNadu · 2026-08-17
- Sacks反驳Amodei:抨击其监管论述为稻草人谬误 — markjeffrey · 2026-08-17
- DeepSeek插件遭黑产利用,引发生态安全热议 — Xianbao_QIAN · 2026-08-17
- 持续学习一旦普及,本地权重副本将让安全护栏失效 — AashaySachdeva · 2026-08-17
- OpenAI沙箱选择遭质疑:安全研究者辩论隔离难点 — dyn___ · 2026-08-17