中位32次任务调用,托管技能行为缺口最多被补上86.8%

Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction

Yu-Lin Tsai, Yu-An Lu, Ci-Yang Tsai, Muxi Lyu, Raluca Ada Popa, Chia-Mu Yu

cs.CR, cs.AI, cs.LG

2026-08-27

Daydreaming把托管技能当黑盒系统辨识:只交普通任务、只看最终结果。7个技能、3个受害者模型上,中位32次调用补上35.8%–86.8%的行为效用缺口,现有泄密过滤挡不住。

这篇在解决什么

Agent skill 已经从一段 system prompt 变成可安装的程序包:一份 SKILL.md,加上脚本、参考表、阈值和模板。托管方可以只卖任务结果、不给文件,论文把这种形态叫 Skill-as-a-Service。法律、安全运营、按次计费的客服已经按这个样子收费,服务条款也禁止用输出去复刻竞品。

现有防护盯的是泄密路径:有人问「把 SKILL.md 打出来」,就拦输入、滤输出。付费客户本来就会提交这个服务要完成的普通任务。论文把这条通道叫 work path。只要隐藏规则会让结果不同,结果本身就是观测。Berkeley 与阳明交大的 Daydreaming 把这条通道当成黑盒系统辨识问题来打。

方法

Daydreaming 是纯执行攻击。每一问都是一份正经任务,从不要求对方出示技能,也不让对方给重构稿打分。披露过滤全程开着。攻击者只拿到公开技能卡片(名字加一句短描述),按部署能看到的东西分成三档:

主实验卡在最严的 Output。能在这一档打成,更宽的观测自然也能用。

重构分三阶段,每阶段共用同一套循环:提出互斥假说,造一份会让假说给出不同可见结果的判别任务,拿受害者结果淘汰假说。攻击者在本地跑影子 agent 做预测,候选技能不会发给受害者。判别不了就不花那一次调用。

名义预算每技能 96 次调用,实际中位大约 32 次。攻击模型固定为 gemini-3.7-flash。

结果

评测改编自 SkillsBench 的 7 个技能、5 个留出任务,装到 glm-5.3 上打分。无技能基线的成功率 / 行为效用(SR / U)是 0.314 / 0.566,原技能是 0.629 / 0.843。NU 把这条缺口当成 100%,看重构补上了多少。

来源模型SRUNU
kimi-k30.5430.80686.8%
claude-opus-50.4000.76471.6%
gpt-5.6-sol0.3710.66535.8%

86.8% 是最好一组,不是平均。网络入侵这项原技能 SR 为 1.000,三组重构都是 0.000,只在中间步骤上有分。采购规划无技能已经 SR=1.000,天花板很薄。

对照攻击里 Daydreaming 的 U 全面最高。Fixed Probes 预先造好任务再一次合成,opus / gpt 上 SR 更高(0.533 / 0.600 对 0.400 / 0.371),U 掉到约 0.64。BBS 直接套原文,252 次里 251 次被输入检测挡掉。SigLeak 要看轨迹,还要一次关掉技能的对照跑,不在 Output 设定里。

结构对不上功能。精确常数 F1 只有 0.018,阈值分支 0.050,路径和脚本 0.200。能干活不必是原文复印件。

把同一批任务冻结后提高可见性:opus 上 Output 的 NU 是 71.6%,Trace 升到 87.0%,Differential 是 86.0%。多出来的信息主要来自工具轨迹。拆掉第一阶段的文件名筛选或第二阶段的判别任务,U 会掉到 0.624 和 0.626,是最大的两刀。

四套额外防御(改写查询、5-gram 滤输出、PSM 护盾、缩短技能卡片)没有同时压低 SR 和 U。5-gram 滤掉 179 条回复里的 18 条,U 从 0.395 降到 0.367,SR 没降。七个技能合计,攻击端花 0.22 美元,受害者侧 API 约 79 美元。

为什么重要

对卖托管技能的人:藏文件、拦「把 prompt 打出来」挡不住付费客户。客户提交的就是你要他们提交的任务。中位 32 次调用,攻击端每技能大约 3.5–15 美元,就能拿到一份可安装的替代包。服务条款禁止复刻,技术上还是挡不住。

对用 skill 的人:Claude Code 一类本地装包,和托管方藏在服务器后的包,威胁模型不一样。这篇打的是后者。但「规则写在文件里、结果交出去」这件事,任何把决策卖成 API 的系统都成立。

这是一次系统辨识,不是一次越狱。

局限与存疑

留出任务只有 5 个,其中两项无技能就已经很高,网络入侵重构 SR 全零。多技能协作的硬任务还没被偷走。评测默认把偷来的包装到 glm-5.3 上跑,不是装回受害者自己。跨模型迁移不对称:opus 的重构相对能搬,gpt-5.6-sol 的重构搬到 opus 上 NSR / NU 都是 0。编排策略也绑死结果,deepagents 上 NU 0.965,claudeagentsdk 掉到 0.234。

文摘写 4 个 victim,主表是 3 个;86.8% 和 Trace 的 87.0% 也不是同一组实验。结构几乎对不上却宣称功能接近,文本相似度与效用的相关在置信区间里穿过零。作者承认精确源码从观测上不可辨识,也没给出能挡住 work path 的办法。实验只用受控基准技能,没有打生产系统。

术语

原文与代码

社区讨论

相关论文

全部论文解读