OmniHarness 用符号策略学习让视觉生成能力可泛化

Xu Xu · hf · 2026-09-17

Hugging Face 上发布论文 OmniHarness:面向可泛化视觉生成的符号策略学习框架。针对现有方法的三大局限——任务特定经验蒸馏泛化性差、反思只在任务完成后进行、知识只在下游任务需求出现时才获取——OmniHarness 将验证过的执行过程抽象为符号策略,捕获共享流程与适用条件、剥离实例特定输入,并可对新任务实例化、适配与组合这些策略。

执行中由中间验证引导修正与失败恢复;通过自主探究,在下游目标确定前就能在能力边界附近生成并执行练习任务,用执行反馈持续改进策略,而模型参数保持冻结。

实验覆盖 6 个 benchmark、3 个 MLLM 骨干、3 个视觉 agent 框架:在 ComfyBench Creative 任务上达到 95.0% 解决率,超过最强基线 27.5 个百分点;冻结的策略快照可即插即用地提升现有视觉 agent 系统。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →