OmniHarness:视觉智能体自主练习攒经验,创意任务解决率达 95%
新智元 · wechat · 2026-09-18
北航、港中文与新加坡国立大学团队发布 OmniHarness:让视觉智能体在下游任务到来前自主练习、验证结果,把有效流程沉淀为可复用策略。在 ComfyBench 创意任务上达到 95%,超过最佳对照 SymbOmni 27.5 个百分点;用 GPT-4o 推理时总体解决率 89.5%,换 Codex 规划升至 92.5%。
方法分三步:选题上,每轮生成 10 道候选题,按新颖性与能力边界评分乘积选题,偏向「有基础仍有挑战」的任务;执行上,把计划编译为 ComfyUI 工作流,逐步检查并局部修复失败;积累上,成功流程抽象为策略库(含工作流模板、适用条件、资源依赖),失败则记录证据与修正方法,可靠性随调用更新。
经验可迁移:冻结的策略库接入其他智能体后,ComfyAgent 从 32.5% 升至 57%,ComfyMind 从 83% 升至 88%,SymbOmni 达 89%,创意任务增幅最大;图像策略还能适配到视频工作流,视频任务总体解决率 85.9%。代价是自主练习与多轮验证增加计算开销,检索效率仍有优化空间。论文:arxiv.org/abs/2609.16057。
所属事件:OmniHarness 让视觉智能体自主练习,创意任务解决率达 95%(2 条相关)→
「多模态」频道最新
- 博主预测:过半 AI 视频将由代码渲染生成,而非纯扩散模型 — _AustinCalvert_ · 2026-09-19
- 网友实测 GPT 图像模型:70s 科幻风格九宫格出图质感惊艳 — aziz4ai · 2026-09-19
- Codex 内置 Images 2.5:先用图像模型重设计页面再实现 — OpenAIDevs · 2026-09-19
- ComfyMax 音乐视频导演工作流:AI 生成 MV 制作进行中 — DanielVeres · 2026-09-19
- Jina AI 发布 jina-ocr-v1 文档理解模型,冲上 Hugging Face 热榜 — jinaai · 2026-09-19
- Reddit 求助:能否用 Agent 自动搭建 ComfyUI 视频工作流 — Hopeful-Election-783 · 2026-09-19