UniEvo-VL:多模态模型用自身反馈提升图像生成能力
StanfordAILab · x · 2026-10-05
Stanford AI Lab 转发的最新研究 UniEvo-VL 探索:当生成与理解统一于同一多模态模型时,模型能否给自己的生成结果打分,并把这种评估能力转化为训练信号(on-policy 自蒸馏),实现自我改进。
基于 Qwen-image-2512 构建,效果提升明显:
- GenEval:0.747 → 0.808
- GenEval2 Soft-TIFA:32.97 → 35.53
结果表明自生成反馈确有训练价值,但其适用边界同样值得注意。
「多模态」频道最新
- 用 Fable 5.5 做的「Claude 踩点」动画,网友直呼可爱 — ring_hyacinth · 2026-10-05
- Reddit 用户用 Google Flow 免费额度生成视频演示 — clooneyge · 2026-10-05
- 单人开源 MIR MEDIA LABS:一块 N 卡本地跑全流程媒体生成 — Da_QbanBeast · 2026-10-05
- 本地复刻 GPT 半写实 3D 动漫风:LoRA+工作流+提示词全公开 — AI-Make-NSFW-Stuff · 2026-10-05
- 用 Claude 从多张照片反向重建 Blender 模型,作者晒 WIP 尝试 — jwt0625 · 2026-10-05
- 1:5 微缩女侠闯便利店:一段可复用的电影级视频提示词 — SimplyAnnisa · 2026-10-05