DyRef 让多参考图像编辑分数从 4.97 提到 8.38
量子位 · wechat · 2026-07-29
- DyRef 解决的是复杂多参考图像生成:模型要同时处理身份、背景、姿态、光照和风格,而且这些参考条件之间不能互相打架。
- 团队还构建了 OmniRef-Bench,包含 395 个样本,覆盖 5 类参考图,每个样本 2 到 7 张参考图,最多同时出现 4 类参考信息。
- 方法上,DyRef 采用两阶段训练:先监督微调打基础,再用强化学习做 动态奖励优化,让更难的样本在训练中占更大权重。
- 在 OmniRef-Bench 上,文中称 Qwen-Image-Edit-2511 的 MLLM 平均分从 4.97 提升到 8.38,缩小了与 NanoBananaPro 的差距,并超过了 Seedream4.5。
- 文章还提到,它在 MultiBanana、OmniContext 以及单图编辑基准 ImgEdit、DreamBench++ 上也有提升。
「多模态」频道最新
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24
- MiniMax H3 本地生成 Pudgy Penguins 音乐视频 — cocktailpeanut · 2026-08-24
- Thrixel 一小时生成可玩 3D 森林与 BOSS — RanaHanocka · 2026-08-24
- 30 年动画人用 AI 赋予角色生命,作品 The Latent Stroke — Paferkas-71 · 2026-08-24
- 用 Minimax H3 制作风世界开场动画,含完整工作流 — Routine_Ad_3391 · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24