LFM2.5训练细节:MOPD与agentic RL两阶段最有趣

SergioPaniego · x · 2026-08-04

LFM2.5-2.6B 训练中两个最有趣的阶段:MOPD(学生生成,每个提示路由到领域教师进行token级反馈,教师从同一SFT检查点分支,信号接近学生分布)和 agentic RL(在真实环境中进行多轮GRPO,每个rollout一个沙箱,代理捕获token级轨迹,而环境保持黑盒)。

所属事件:LFM2.5-2.6B发布:小参数模型击败大模型(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →