多域 on-policy 蒸馏:让一个模型同时学多种技能

helloiamleonie · x · 2026-09-25

Leonie 介绍 LFM2.5 训练中的 MOPD(multi-domain on-policy distillation):把 on-policy 蒸馏扩展为多个 teacher 并行,学生模型可以同时从各领域专家 teacher 学习不同技能,而不必分阶段训练。这是该线程后训练配方中把多个专项教师的能力合并回单一 checkpoint 的关键步骤。

所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →