LFM2.5训练细节:MOPD与agentic RL两阶段最有趣
SergioPaniego · x · 2026-08-04
LFM2.5-2.6B 训练中两个最有趣的阶段:MOPD(学生生成,每个提示路由到领域教师进行token级反馈,教师从同一SFT检查点分支,信号接近学生分布)和 agentic RL(在真实环境中进行多轮GRPO,每个rollout一个沙箱,代理捕获token级轨迹,而环境保持黑盒)。
所属事件:LFM2.5-2.6B发布:小参数模型击败大模型(3 条相关)→
「模型」频道最新
- Qwen3.8-Max 网络安全实测:找漏洞比肩 Opus 5,但一致性较差 — teortaxesTex · 2026-08-05
- Grok 模型接入 GitHub Copilot,实测构建全栈应用表现 — DanWahlin · 2026-08-05
- Yacine 吐槽模型太贵,当前首选 GPT 与 DeepSeek 组合 — yacineMTB · 2026-08-05
- 通义万相 3.0 Pro 登顶全球第五,图像生成竞技场得分大涨 — Alibaba_Qwen · 2026-08-05
- MiniMax H3 MLX转换库开源,提供苹果本地部署细节 — cocktailpeanut · 2026-08-05
- MiniMax H3模型本地部署教程:通过Pinokio一键安装 — cocktailpeanut · 2026-08-05