FrogNano 揭秘:自适应合成 RL 环境练出 4B 编程模型
sivareddyg · x · 2026-09-09
FrogNano 团队公布技术细节:基于 Qwen3.5-4B,用 TaskPilot 生成的合成任务做纯 RL 后训练,零蒸馏、零教师轨迹 SFT,仅 5 轮迭代 × 300 任务(共 1500 个任务后停更),SWE-bench Verified 达 61.5%。
核心方法是「on-policy 数据」:针对当前策略的可学习区间动态生成合成 RL 环境,并根据 rollout 反馈持续调整。作者称对 TB2、SwePro、PatchEval 的泛化出乎意料,尚待弄清训练斜率何时趋于平缓。作者认为这种持续自适应的合成环境生成将是强化学习数据的大方向。
所属事件:FrogNano 4B 模型纯 RL 训练拿下 SWE-bench 61.5%(2 条相关)→
「编程与Agent」频道最新
- ChatGPT iOS 更新:Remote 支持新的异步提问工具 — Dimillian · 2026-09-09
- ACP 协议走红:不交数据也能用上同级 AI 智能体能力 — RileyRalmuto · 2026-09-09
- 2026 年评测 AI Agent 的工具无关三步框架 — Al_Grigor · 2026-09-09
- Agent 一天交付 10 个功能、374 测试全绿,页面却没渲染 — Sinjared · 2026-09-09
- 2 小时手机造出可玩赛车游戏:两条让 AI 一次改对的高杠杆提示技巧 — blakesamic · 2026-09-09
- 15 年剪辑老手用 Claude+DaVinci MCP 剪片,一天省下 10 小时 — _AustinCalvert_ · 2026-09-09