斯坦福推出 UniEvo-VL:单模型自当师生实现自进化

Stanford NLP 发布 UniEvo-VL 训练框架,采用无需外部教师的「在-policy 自蒸馏」方法:同一多模态模型同时扮演教师与学生,教师端可看到模型自身生成的批评作为特权信息,通过自我构造的反馈信号迭代学习。该框架在无外部监督条件下即可提升模型的图像生成等能力,实现多模态模型的自我进化。

2026-10-01 ~ 2026-10-01 · 2 条相关