Daydreaming 攻击复现:32 次黑盒调用即可偷走 Agent 技能
rohanpaul_ai · x · 2026-09-03
UC Berkeley 论文《Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction》(arXiv:2608.26733)详述针对托管 agent skill 的纯执行攻击:受害者从不被要求泄露技能,攻击者自适应构造任务区分可能的隐藏行为,用攻击者控制的 shadow agent 选设计,再结合存储的受害者结果与本地执行检查补全每个文件。
论文形式化了 Differential/Trace/Output 三层威胁级别,聚焦只看最终输出与返回文件的 Output 级。在 7 个技能、4 个受害模型上,Output 级还原 86.8% 原技能能力,约为 SigLeak 的 4 倍;即使披露防御开启,中位每技能仅需 32 次调用即可产出可安装的技能。结论:隐藏技能文件并过滤请求不足以防御,工作接口本身需要保护。
所属事件:伯克利论文揭露黑盒攻击可窃取 Agent 隐藏技能(2 条相关)→
「编程与Agent」频道最新
- 开发者吐槽:LLM 被过度优化成一锤子买卖,不肯中途要反馈 — Elijah_Meeks · 2026-09-03
- Namespace 携手 Cursor,为云端 agent 原生提供 Mac/Linux 开发机 — dean_rie · 2026-09-03
- 开源 MCP 工具让编码 Agent 直观「看到」iOS 模拟器界面 — ivanzhaowy · 2026-09-03
- Meta 开源 CORAL:LLM 智能体闭环优化生产级推荐系统 — _reachsumit · 2026-09-03
- 写了 5 份设计文档的 allowlist 竟从未被运行时读取 — Thirumalaiboobathi · 2026-09-03
- 开发者弃用 --help:用 atuin ai 查不熟的命令行 — braelyn_ai · 2026-09-03