伯克利论文揭露黑盒攻击可窃取 Agent 隐藏技能

UC Berkeley 论文《Daydreaming》揭示了一种新的 Agent 安全风险:攻击者无需获取隐藏 prompt 或内部文件,仅通过向 Agent 提交正常客户任务并观察其输出,即可重建其隐藏技能。研究显示普通任务的输出可还原 86.8% 的隐藏技能,复现攻击仅需 32 次黑盒调用即可偷走 Agent 的技能,凸显了 Agent 部署中比 prompt 泄露更难防范的安全问题。

2026-09-03 ~ 2026-09-03 · 2 条相关

另有 1 条近重复转述:rohanpaul_ai