OmniHarness 用符号策略学习让视觉生成能力可泛化
Xu Xu · hf · 2026-09-17
Hugging Face 上发布论文 OmniHarness:面向可泛化视觉生成的符号策略学习框架。针对现有方法的三大局限——任务特定经验蒸馏泛化性差、反思只在任务完成后进行、知识只在下游任务需求出现时才获取——OmniHarness 将验证过的执行过程抽象为符号策略,捕获共享流程与适用条件、剥离实例特定输入,并可对新任务实例化、适配与组合这些策略。
执行中由中间验证引导修正与失败恢复;通过自主探究,在下游目标确定前就能在能力边界附近生成并执行练习任务,用执行反馈持续改进策略,而模型参数保持冻结。
实验覆盖 6 个 benchmark、3 个 MLLM 骨干、3 个视觉 agent 框架:在 ComfyBench Creative 任务上达到 95.0% 解决率,超过最强基线 27.5 个百分点;冻结的策略快照可即插即用地提升现有视觉 agent 系统。
「多模态」频道最新
- 阶跃星辰发布首个音乐生成基座模型 StepAudio 3 Music — StepFun_ai · 2026-09-17
- 阶跃星辰联合 ACE Studio 发布 StepAudio 3 音乐基础模型 — StepFun_ai · 2026-09-17
- 作者用 AI 复刻 Blue Archive 白子初遇名场面并预告教程 — Wakaiko · 2026-09-17
- 27 岁英国开发者因 AI 辞职单干,做出 $0.39 一条的视频工具 — JaynitMakwana · 2026-09-17
- Wan2GP 实用技巧:把参考图注入首帧实现角色一致性生成 — protocol-apps · 2026-09-17
- AI 重现权游:Brandon 与 Rickard Stark 之死片段引围观 — Battlefleet_Sol · 2026-09-17