LFM2.5-2.6B发布:小参数模型击败大模型
LFM2.5-2.6B模型正式发布,该仅有26亿参数的模型在指令遵循和工具使用方面成功击败了更大的模型。其核心训练流程结合了SFT、在线蒸馏和强化学习等技术,其中MOPD(混合在线策略蒸馏)和agentic RL两个阶段最为关键。通过将完整的Agent训练流程压缩进极小参数量,展现了小模型在智能体领域的巨大潜力。
2026-08-04 ~ 2026-08-04 · 3 条相关
- LFM2.5-2.6B发布:完整Agent训练流程压缩进2.6B参数 — SergioPaniego · 2026-08-04
- LFM2.5训练细节:MOPD与agentic RL两阶段最有趣 — SergioPaniego · 2026-08-04
- 26亿参数模型击败大模型:智能体训练实战解析 — SergioPaniego · 2026-08-04