D-OPCD 把 Agent 经验蒸馏进扩散模型权重,四基准平均分升至 65.09
Wenxuan Wang · hf · 2026-10-08
用 agent harness 包裹图像生成模型可显著提升文生图效果(记忆、技能、工作流编排、结果验证与迭代改写 prompt),但这些增益依附于 harness。论文提出 Diffusion On-Policy Context Distillation(D-OPCD):把 agent 改进后的 prompt 视作特权上下文,将 harness 中的知识蒸馏进扩散模型权重,使模型仅凭原始 query 也能保留部分增益。
要点:
- 配合提出的 Auto Skill Evolver(ASE)文生图 agent,D-OPCD 将四个基准上的直接生成平均分从 60.52 提升至 65.09。
- 知识被吸收进权重后,harness 可甩掉饱和技能继续进化:在更新后的生成器上跑第二轮 ASE,比无技能 harness 再提升 1.83 分,指向 harness 与模型持续共同进化的文生图系统。
「多模态」频道最新
- VELA 1.0 发布:非破坏性优化 MiniMax H3 视频,0.8MP 生成从 2:53 缩至 2:13 — NoMouse9610 · 2026-10-08
- InSpatio-World 1.5 开源:单图/视频输入生成可导航 4D 世界 — liuziwei7 · 2026-10-08
- Opus 5.5 用 MCP 驱动 Blender+Suno,3.5 小时无人工做出音画同步神作 — sidahuj · 2026-10-08
- LLM 写 Blender 代码碾压视频模型:最短将杀对局实测 — jyangballin · 2026-10-08
- KAIST LipForcing 实测翻车:面部大幅移动时牙齿糊成白色一块 — Neat_Lab_4435 · 2026-10-08
- 训练100+个Krea 2角色LoRA后:数据质量比数量更决定相似度 — Cold-Worldliness5392 · 2026-10-08