RISEBench++:65类推理型视觉编辑,最强GPT-Image-2.5仅56.6%
VisionXLab · hf · 2026-10-09
- 发布 RISEBench++,首个推理型视觉编辑(RISE)基准的扩展版:覆盖时序、因果、空间、逻辑、反事实五类推理加混合推理,分解为 12 个子类、65 个细粒度任务类型;支持多图输入,含 1000 条人标注中英双语测试用例。
- 评测框架:指令推理、外观一致性、视觉合理性三维度,人工 + LMM-as-a-judge;共评测 58 种方法(34 开源、19 闭源、5 agentic)。
- 结论:推理型编辑仍远未解决,最强的 GPT-Image-2.5 Sunburst 也只有 56.6% 准确率。
- 另提出免训练 agentic 框架 RISE-Agent(推理驱动规划 + 工具执行 + 验证器精修),超过多数现有强方法。
「多模态」频道最新
- TerraVis:用 MLLM 工作流量化文生图的「世界一致性」缺陷 — the-aiml · 2026-10-09
- LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分 — lmarena-ai · 2026-10-09
- 听声音就能认出 Opus 生成的视频,音画同步节奏成新指纹 — hudzah · 2026-10-09
- 孙悟空骑虎下山:AI 视频再现《大圣归来》级国风名场面 — lucky-plume · 2026-10-09
- 自回归检索器 ARR:用已检索条目反馈迭代优化查询理解 — _reachsumit · 2026-10-09
- 索尼 Syn-Omni:共享 LoRA 加模态专家路径,81 项任务领先全模态嵌入基线 — _reachsumit · 2026-10-09