把模型放进 harness 里训练:LFM2.5 的 agentic RL 细节
helloiamleonie · x · 2026-09-25
Leonie 解释 agentic RL 环节:既然模型如今主要通过 agent harness 使用,就直接在 harness 内训练,让模型提前熟悉各 harness 的 system prompt 和内置工具。整体架构分三块:tasks(写演示文稿、分析报告等办公类 agentic 任务)、harness(模型通过 harness 处理任务)、sandbox(每次 rollout 起一个全新沙箱,模型经 harness 与工具和本地文件系统交互)。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「编程与Agent」频道最新
- Pydantic 团队开源 Monty:Python 沙箱 1 毫秒启动,1 万脚本仅 674ms — samuelcolvin · 2026-09-25
- 8 个 Agent 平台跑同一任务仅 2 个完成,6 个连 Slack 消息都发不出 — yiddo_bhushan · 2026-09-25
- Ben Lorica:Agent 时代数据栈不再宽容,陈旧数据直接变成错误动作 — bigdata · 2026-09-25
- Bending Spoons 99% AI 流量跑自托管开源模型,靠 evals 省钱 — alex_verem · 2026-09-25
- 开源项目 AIMessage:给 AI Agent 造一个 P2P 共享记忆网络 — Accomplished-Pen-491 · 2026-09-25
- freebots 接近千个 AI 机器人:136万行代码全由 AI 生成 — Daniel_Farinax · 2026-09-25