SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents
Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li
cs.AI
2026-08-31
SkillZip Pro跨文件压技能包,生产部署少38.1%、每轮token少10.4%;乱压到71%准确率剩70%。
生产里的 agent skill 不是一段 prompt,是一个目录。根上的 SKILL.md 在激活时加载;参考文档、schema、脚本、子技能只在执行路径真正用到时才打开。这是 Claude Code、Codex 已经在用的渐进加载。
旧压缩目标对不上这个成本。只压根文件,磁盘上的大头纹丝不动,还可能把偶发分支写进每次都要加载的根里。把目录拼成一篇再压,渐进边界就没了,路由句子一旦被改写,文件还在磁盘上,agent 已经走不到。阿里和浙大之前的 SkillZip 只能处理单个文档。SkillZip Pro 把对象换成整包资源图。
技能建成有根目录图。四层成本分开记账:目录元数据、激活时的根、一次路径实际加载的内容、整包部署体积。优化目标把这四项加起来,部署项乘 λ=0.05,避免为了磁盘数字把常用路径变贵。命题 IV.1 写得很硬:低频片段升到根上,期望路径成本一定变差,除非磁盘项能把这笔账盖住。
两根支柱。第一根是跨文件压缩:根或环境契约已经保证的内容可以删(host entailment);重复片段只抽到会加载它的作用域里,禁止稀疏提升进根;带显式触发条件的长分支挪到按需胶囊,原地留一行调度。第二根是保路由:路由表锁定,物化目录之后独立回读,任何文件变得不可达就整包打回原文。
删除必须挂证据。W1 是字面包含,别处还有原文;W2 是覆盖门;W3 是温度 0 的判定模型,且禁止两条删除互相作证。接口契约(输出 schema、标签白名单、填过的例子)必须整段连续原文保留。代码、数据、资产按字节锁定。
调度和落盘是两根正交轴。One-Shot 全图重压,Continual 只修补丁闭包,失败时发布带补丁的原文,绝不回滚到旧压缩包。Persistent 改规范目录,Transient 规范包不动、每次跑前建执行视图。
执行器是未改过的 Qwen3.6-Plus。三套自演化技能包上,SkillZip Pro 成功率 BFCL 0.952、数学 0.394、表格 0.333,平均 0.560,对照未压缩演化包 0.905 / 0.364 / 0.354、平均 0.541。人工技能平均 0.564,数学列仍最高。相对演化包,部署 token 从 2649 降到 2112(少 19.7%),根从 212 降到 196(少 7.3%),单次路径从 588 降到 500(少 14.3%)。只压根的 SkillZip 把根砍掉 27.8%,部署几乎没动,路由保真是 0.000。扁平拼接部署少 63.8%,指令行只留下 0.241,路由同样是 0。
102 道留出题的成对 bootstrap 里,SkillZip Pro 成功率 0.480,相对演化包 +0.010,95% 区间 [-0.029, +0.059],是唯一跨过「质量保持」门槛的压缩器。加载上,应加载资源召回 0.755,对照演化包 0.795;无关加载 0.193 对照 0.171;可达文件从 6.3 升到 10.3,多出来的是共享模块和胶囊。指令行保留 0.986,重复文本清掉 0.736,路由 1.000。
在持续演化的技能库上,Continual 加重打包:部署少 48.1%,单次路径少 28.2%,每轮压缩模型调用 3.31 次,对照每轮全量重建的 10 次,耗时 0.068 秒对照 0.234 秒。真实演化库上,能发布时部署少 34.7%,最强仍忠实的基线是 25.0%。
生产内容审核技能更刺眼。根约 2 万 token,三份按需参考,一份锁定风险表,一次审核平均约 13 轮推理,100 条真任务。不加保护类,部署少 71.4% / 75.8%,准确率从 88.00% 掉到 70.00% / 62.00%,假阳性从 10 升到 29 / 35。只开 W1/W2 部署少 13.8%。受限 W3 提到 32.7%。把 W3 开进反复加载的根(v3)部署少 38.1%,200 次成对会话里端到端 token 少 10.4%,准确率 89.00%、假阳性 9,对照同会话未压缩的 92.00% 和 91.00%。静态加载模型只预言约 3% 的单次节省,短根在多轮推理里被放大了。无审计的 Persistent 会把公开子技能改名,发现率和独立成功率都是 0.000。
如果你已经在用带目录的 skill,只压 SKILL.md 是一种很安静的事故:文件还在,agent 选不到。SkillZip Pro 的部署故事是 harness 不动、输出仍是普通目录、失败回退原文。71% 和 38% 的对照说明,压缩上限由证据强度决定,不由目标比率决定。
这是工程上的渐进,不是新的 agent 算法。Continual 大约用三分之一的模型调用追平全量重建,适合会自己往 skill 里写补丁的系统。
忠实性保的是显式契约,不是每个模型读到的暗示和语气。流量未知时用均匀叶子权重,胶囊和共享模块的位置会随路径分布变。中文生产包上,只认英文的确定性抽取器在 264 条指令里只标出 7 条必留项。BFCL 留出只有 21 题,表上 0.952 对 0.905 只隔几题。SkillReducer 被关掉了基于评估的候选选择,对照并不完整。λ=0.05 是透明默认值,不是估出来的。作者也写了:evaluation-free 描述的是压缩算法,不是发论文时可以不做留出评测。