LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走

helloiamleonie · x · 2026-09-25

Leonie 拼回 LFM2.5-2.6B 后训练的完整拼图:1) 经典 SFT,加入 agent 轨迹数据与 antidoom 训练;2) SFT+RL 配方训练多个专项 teacher,每个对应一项技能;3) 用 MOPD(多域 on-policy 蒸馏)把所有技能蒸馏回单一 checkpoint;4) 通过 agentic RL 微调模型对 agent harness 的适配。基准显示 2.6B 模型可与 3 倍大的 Qwen3.5-9B 竞争。

所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →