Berkeley 论文:普通任务输出可还原 86.8% Agent 隐藏技能

rohanpaul_ai · x · 2026-09-03

UC Berkeley 论文 Daydreaming 揭示一个更难的 agent 安全问题:攻击者不需要拿到隐藏 prompt 或文件,仅通过提交正常客户任务、观察输出,就能重建一个可移植的技能替代品——在 Output 威胁级别下平均还原原技能 86.8% 的能力。

关键点:

对托管 agent skill 卖家的建议:保护工作接口本身——减少输出细节、少暴露执行轨迹、限制并审计自适应探测。

所属事件:伯克利论文揭露黑盒攻击可窃取 Agent 隐藏技能(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →