FrogNano 揭秘:自适应合成 RL 环境练出 4B 编程模型

sivareddyg · x · 2026-09-09

FrogNano 团队公布技术细节:基于 Qwen3.5-4B,用 TaskPilot 生成的合成任务做纯 RL 后训练,零蒸馏、零教师轨迹 SFT,仅 5 轮迭代 × 300 任务(共 1500 个任务后停更),SWE-bench Verified 达 61.5%。

核心方法是「on-policy 数据」:针对当前策略的可学习区间动态生成合成 RL 环境,并根据 rollout 反馈持续调整。作者称对 TB2、SwePro、PatchEval 的泛化出乎意料,尚待弄清训练斜率何时趋于平缓。作者认为这种持续自适应的合成环境生成将是强化学习数据的大方向。

所属事件:FrogNano 4B 模型纯 RL 训练拿下 SWE-bench 61.5%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →