UniEvo-VL:多模态模型用自身反馈自我蒸馏,GenEval 从 0.747 升至 0.808
yining_hong · x · 2026-10-02
新工作 UniEvo-VL 探索多模态模型的自我改进:当图像生成与理解能力合于一体,模型可以对自己的生成结果给出反馈,并把这种评估能力转化为训练信号。方法是在 Qwen-image-2512 基础上做 on-policy 自蒸馏(从自身生成的反馈中学习)。效果:
- GenEval:0.747 → 0.808
- GenEval2 Soft-TIFA:32.97 → 35.53
作者还指出边界所在:用更强外部 critic 的实验显示仍有提升空间,核心挑战在于「产出反馈只是开始」,如何让反馈真正驱动生成质量提升仍待解决。
所属事件:Stanford 发布 UniEvo-VL:多模态模型自当师生实现自我进化(3 条相关)→
「多模态」频道最新
- GPT Image 2.5 Sunburst 对比 Ideogram 4.5:疑似局部重绘仍砍掉半边头 — CSProfKGD · 2026-10-02
- AI 生成「SCP 宇宙」内容,视觉向作品引围观 — imjustnewatai · 2026-10-02
- 9070 XT 上 SageAttention 提速近 2 倍:作者手写 HIP kernel 并放出 wheel — Familiar_Worry332 · 2026-10-02
- 开发者用 Scenario MCP 重制 SNES 游戏 DeadFall 全部素材 — AIandDesign · 2026-10-02
- Midjourney+Seedance 2.5 全流程:AI 短片《Beauty and the Beach》创作揭秘 — Kyrannio · 2026-10-02
- Reddit 教程:数据集准备加 LoRA 训练一体化接入 Comfy — no3us · 2026-10-02