UniEvo-VL:多模态模型用自身反馈自我蒸馏,GenEval 从 0.747 升至 0.808

yining_hong · x · 2026-10-02

新工作 UniEvo-VL 探索多模态模型的自我改进:当图像生成与理解能力合于一体,模型可以对自己的生成结果给出反馈,并把这种评估能力转化为训练信号。方法是在 Qwen-image-2512 基础上做 on-policy 自蒸馏(从自身生成的反馈中学习)。效果:

作者还指出边界所在:用更强外部 critic 的实验显示仍有提升空间,核心挑战在于「产出反馈只是开始」,如何让反馈真正驱动生成质量提升仍待解决。

所属事件:Stanford 发布 UniEvo-VL:多模态模型自当师生实现自我进化(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →