斯坦福推出 UniEvo-VL:单模型自当师生实现自进化
Stanford NLP 发布 UniEvo-VL 训练框架,采用无需外部教师的「在-policy 自蒸馏」方法:同一多模态模型同时扮演教师与学生,教师端可看到模型自身生成的批评作为特权信息,通过自我构造的反馈信号迭代学习。该框架在无外部监督条件下即可提升模型的图像生成等能力,实现多模态模型的自我进化。
2026-10-01 ~ 2026-10-01 · 2 条相关
- Stanford NLP 推出 UniEvo-VL:自蒸馏训练让多模态模型自我进化 — stanfordnlp · 2026-10-01
- UniEvo-VL:单模型自当师生,无监督自进化提升图像生成 — _akhaliq · 2026-10-01