反直觉发现:通用合成数据训练蒸馏adapter效果胜过自生成数据

ostrisai · x · 2026-09-24

开发者ostris在训练Ming Image模型的蒸馏adapter时发现一个反直觉结果:V1用普通50/50通用合成数据集训练(因没时间用模型生成专用数据),效果出奇地好;V2按惯例用模型自生成数据认真训练,反而不如V1。

他推测原因是:模型"认识"自己的数据,因此蒸馏 breakdown 不够彻底;而自合成数据的adapter一直无法承受长时间训练(已知限制),通用数据混合训练的adapter却没有这个问题。在14k步的长训练后,通用数据版对蒸馏知识的保留显著更好。他强调单一案例尚需更多探索,完美平衡的数据集配方仍待研究。

所属事件:反直觉发现:通用合成数据蒸馏效果胜过自生成数据(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →