UniEvo-VL 让图像模型自我纠错,GenEval 从 74.7% 提到 80.8%
mark_k · x · 2026-10-02
新论文 UniEvo-VL 提出多模态自我改进机制:模型生成图像后自我批评找出问题,把反馈转化为纠正性指令;教师版生成器看到这些指令,学生模型只看原始 prompt,通过训练把纠错收益固化进学生模型权重,使改进延续到未来生成。
实验结果(基于 Qwen-Image-2512 + Qwen-VL 反馈):
- GenEval 从 74.7% 提升至 80.8%
- 训练前验证候选纠错可达 81.8%
- 引入更强外部评论者后达 88.2%
各任务表现不一,文本渲染任务结果喜忧参半。作者 markk 认为亮点在于把自我批评转化为持久改进:发现错误有用,学会下次避免错误则强大得多。
所属事件:斯坦福推出UniEvo-VL 多模态模型自蒸馏自我进化(4 条相关)→
「多模态」频道最新
- AI 电影人之争:多数人把 LLM 用得太浅,电影级作品仍靠导演功力 — taherdhanera · 2026-10-02
- RTX 5090 实测:软件优化后 LTX 2.5 可生成 60 秒长视频 — OpenEffect3955 · 2026-10-02
- AI 生成 J-pop MV《You & Me(君と僕)》上线 — SeaTransportation457 · 2026-10-02
- AI 音乐视频《さよなら、友よ》分享 — PromptDoStudio · 2026-10-02
- 中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别 — ustc · 2026-10-02
- AI 做商业级视频不手动改,但一条要互动改约 10 次 — AlchainHust · 2026-10-02