OmniHarness:视觉智能体自主练习攒经验,创意任务解决率达 95%

新智元 · wechat · 2026-09-18

北航、港中文与新加坡国立大学团队发布 OmniHarness:让视觉智能体在下游任务到来前自主练习、验证结果,把有效流程沉淀为可复用策略。在 ComfyBench 创意任务上达到 95%,超过最佳对照 SymbOmni 27.5 个百分点;用 GPT-4o 推理时总体解决率 89.5%,换 Codex 规划升至 92.5%。

方法分三步:选题上,每轮生成 10 道候选题,按新颖性与能力边界评分乘积选题,偏向「有基础仍有挑战」的任务;执行上,把计划编译为 ComfyUI 工作流,逐步检查并局部修复失败;积累上,成功流程抽象为策略库(含工作流模板、适用条件、资源依赖),失败则记录证据与修正方法,可靠性随调用更新。

经验可迁移:冻结的策略库接入其他智能体后,ComfyAgent 从 32.5% 升至 57%,ComfyMind 从 83% 升至 88%,SymbOmni 达 89%,创意任务增幅最大;图像策略还能适配到视频工作流,视频任务总体解决率 85.9%。代价是自主练习与多轮验证增加计算开销,检索效率仍有优化空间。论文:arxiv.org/abs/2609.16057。

所属事件:OmniHarness 让视觉智能体自主练习,创意任务解决率达 95%(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →