Berkeley 论文:普通任务输出可还原 86.8% Agent 隐藏技能
rohanpaul_ai · x · 2026-09-03
UC Berkeley 论文 Daydreaming 揭示一个更难的 agent 安全问题:攻击者不需要拿到隐藏 prompt 或文件,仅通过提交正常客户任务、观察输出,就能重建一个可移植的技能替代品——在 Output 威胁级别下平均还原原技能 86.8% 的能力。
关键点:
- 攻击从不要求 agent 泄露 SKILL.md 或文件,只利用服务本来就要完成的任务;
- 重建文件常与原件差异很大,但在新任务上仍能复现大部分行为——"文件保密"不等于"能力不泄露";
- 在 7 个技能、4 个受害模型上验证,效果约为 SigLeak 的 4 倍,中位每技能仅需 32 次调用,且在披露防御开启下依然有效。
对托管 agent skill 卖家的建议:保护工作接口本身——减少输出细节、少暴露执行轨迹、限制并审计自适应探测。
所属事件:伯克利论文揭露黑盒攻击可窃取 Agent 隐藏技能(2 条相关)→
「编程与Agent」频道最新
- 两起署名争议后,开源研究如何在编码 agent 时代自保 — dhruv2038 · 2026-09-03
- Meta Muse Spark 1.3 免费上架 OpenCode — ramagetime · 2026-09-03
- GitHub 宣布 9 月 10 日举办首届 Copilot Day,含产品发布 — PaulShellDev · 2026-09-03
- Maven 企业级 AI Agent 课程详情:$950、含 $500 算力额度 — hugobowne · 2026-09-03
- 六分钟把客服 agent 部署上 Modal,流程全程实录 — hugobowne · 2026-09-03
- 开发者囤 300GB agent 会话日志,公开叫卖 Scale AI — doodlestein · 2026-09-03