LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走
helloiamleonie · x · 2026-09-25
Leonie 拼回 LFM2.5-2.6B 后训练的完整拼图:1) 经典 SFT,加入 agent 轨迹数据与 antidoom 训练;2) SFT+RL 配方训练多个专项 teacher,每个对应一项技能;3) 用 MOPD(多域 on-policy 蒸馏)把所有技能蒸馏回单一 checkpoint;4) 通过 agentic RL 微调模型对 agent harness 的适配。基准显示 2.6B 模型可与 3 倍大的 Qwen3.5-9B 竞争。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「模型」频道最新
- 用户控诉 Google:$20 AI 附加费后企业版 Gemini 卡在旧模型 — thedealdirector · 2026-09-25
- Google $20 AI 附加订阅被指锁死旧模型,企业版 Gemini 停在旧版 Flash — thedealdirector · 2026-09-25
- 阶跃 Step-5-Preview 实测:输出极稳,擅长 Agent Loop 打磨细节 — karminski3 · 2026-09-25
- Opus 5.5 登 WeirdML v3 得 31.2%,超 Fable 5.1 但远落后 GPT 6 Astra — scaling01 · 2026-09-25
- Sora API 今日正式关停,OpenAI 未提供替代产品 — VraserX · 2026-09-25
- 「LLM 终将亲手写汇编」?Greg Mushen 看到一个例子不再怀疑 — gregmushen · 2026-09-25