冻结模型扩技能库76到139,设计成功率拉到99.3%

Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

Hongyang Du, Lan Yan, Christian Flores, Asim Kadav

cs.AI, cs.CV

2026-09-19

Adobe用自然语言技能库给冻结设计Agent做持续适应,全程不改权重;五轮后技能从76增至139,Sonnet在GenEval2执行成功率从72.7%升到99.3%。

这篇在解决什么

专业平面设计是长程 agent 任务:一个作品要经过几十步互相咬合的工具调用,产出可编辑的分层文件。终端分数很难归因到某一步,brief 里既有「字号、颜色、位置」这种硬约束,也有层级和构图这种主观标准,没有像单元测试那样的成功预言机。

权重更新在这里不现实。模型往往是托管的前沿模型,演示数据贵,结果奖励又吵。Photoshop 动作那种固定宏太死,整段轨迹记忆又太宽。需要一种夹在原子工具和整条轨迹之间的、模型读得懂也能改的程序说明。

方法

冻结的语言模型通过 230 多个工具操作 Photoshop、Illustrator、InDesign 的等价接口,检索真实素材,渲染中间文档给多模态检查。学习对象只有外部技能库:每条技能是一份自然语言 playbook,运行时检索 top-k 注入上下文,并收窄可见工具列表。关掉检索就回到原来的无技能 agent,对照干净。

技能库沿两条轴长:

提案和准入分开。匹配重放门在同一批冻结上下文里做成对比较,候选必须至少赢一个 prompt、且不输任何一个,才准入。绝对分数不用,因为 VLM 评分会漂。五轮共 1406 条 brief、1869 条自动打分轨迹,没有人工标签,也没有权重更新。

结果

技能库从文档蒸馏的 76 条冷启动长到 139 条。门控拒绝了 100/231 次改写和 67/136 次新铸。新技能到冷启动库的最近邻距离中位数 0.215,高于冷启动内部间距 0.158,说明拓宽补的是缺口,不是换个说法。

在 200 条固定的人工 brief 上,第 5 轮把完整度 ≥0.5 的比例从 86% 提到 93%,≥0.9 从 43% 提到 56%,满分从 24% 提到 32%。轨迹不是单调的:第 4 轮低端回退,因为新技能还没被改写;第 5 轮 21 次改写、4 次新铸,两端一起回升。

骨干指标无技能 → 进化后
Claude-Sonnet-4GenEval2 成功率72.7% → 99.3%
Claude-Sonnet-4DPG-Bench 成功率82.7% → 100%
Claude-Sonnet-4GenEval2 质量+11.99
Claude-Opus-4.6设计基准总胜率67.6%
Claude-Sonnet-4设计基准总胜率61.8%

消融最关键:只改写或只新铸,对 200 条留出 brief 的胜率是 48.6% 和 49.4%,合在一起才到 58.5%(p=0.025)。完整度从冷启动 68.62 升到 74.04,美学几乎不动(65.92→66.53)。延迟开销 3.4%–6.2%。

为什么重要

这是一条不碰权重、也能从用户流量里持续适应的路,适合工具极多、结果不可程序验证的创意软件。拓宽补覆盖,加深补可靠,两条轴必须耦合:新技能要靠改写才能稳,改不动的失败再回流去铸新技能。冷启动文档技能单独上线甚至略差于无技能(胜率 46.4%),说明「把手册塞进上下文」不够。

从业者如果已经有工具型 agent,优先值得抄的是重放门,不是再训一遍模型。

局限与存疑

自然语言技能描述了偏好流程,检索却拦不住模型走自己的默认策略。细几何操作受感知和自动验证两边限制,长流程指令会在多步里走样。重放门只对重放集合局部成立,不保证全流量单调变好。第 4 轮已经演示过一次低端回退。评分和胜率都靠 VLM/LLM 裁判,和真实设计师偏好还有缝。主实验排除了个性化技能。Qwen3.6-27B 质量分看起来高,但成功率低,质量是在成功样本上算的,容易偏向简单题。

术语

原文与代码

相关论文

全部论文解读