Daydreaming 攻击复现:32 次黑盒调用即可偷走 Agent 技能

rohanpaul_ai · x · 2026-09-03

UC Berkeley 论文《Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction》(arXiv:2608.26733)详述针对托管 agent skill 的纯执行攻击:受害者从不被要求泄露技能,攻击者自适应构造任务区分可能的隐藏行为,用攻击者控制的 shadow agent 选设计,再结合存储的受害者结果与本地执行检查补全每个文件。

论文形式化了 Differential/Trace/Output 三层威胁级别,聚焦只看最终输出与返回文件的 Output 级。在 7 个技能、4 个受害模型上,Output 级还原 86.8% 原技能能力,约为 SigLeak 的 4 倍;即使披露防御开启,中位每技能仅需 32 次调用即可产出可安装的技能。结论:隐藏技能文件并过滤请求不足以防御,工作接口本身需要保护。

所属事件:伯克利论文揭露黑盒攻击可窃取 Agent 隐藏技能(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →