多域 on-policy 蒸馏:让一个模型同时学多种技能
helloiamleonie · x · 2026-09-25
Leonie 介绍 LFM2.5 训练中的 MOPD(multi-domain on-policy distillation):把 on-policy 蒸馏扩展为多个 teacher 并行,学生模型可以同时从各领域专家 teacher 学习不同技能,而不必分阶段训练。这是该线程后训练配方中把多个专项教师的能力合并回单一 checkpoint 的关键步骤。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「研究」频道最新
- 裸盖菇素改变脑活动时间结构,与主观体验相关 — adeelrazi · 2026-09-25
- 指数均值方差爆炸,Francis Bach 博客提出最小二乘补救方案 — BachFrancis · 2026-09-25
- 威廉玛丽学院 AI Frontier Lab 5 篇论文入选 NeurIPS — jindong_wang92 · 2026-09-25
- 人大团队开源 EvoOntology:为数据 Agent 构建自进化本体层 — JeremyCMorgan · 2026-09-25
- LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走 — helloiamleonie · 2026-09-25
- 把 Qwen3.8 的 n-gram 记忆移植进 0.8B 小模型,困惑度降 5.05% — Nicolodeva · 2026-09-25