FrogNano 4B 模型纯 RL 训练拿下 SWE-bench 61.5%
FrogNano 团队公布基于 Qwen3.5-4B 的编程模型及其技术细节:完全不用蒸馏、零教师轨迹 SFT,仅靠 TaskPilot 自适应生成的合成任务做纯强化学习后训练,经过 5 轮迭代 × 300 个任务,即在 SWE-bench 上取得 61.5% 的成绩,展示了合成 RL 环境训练小模型的高性价比路径。
2026-09-09 ~ 2026-09-09 · 2 条相关
- FrogNano:4B 纯 RL 训练模型拿下 SWE-bench 61.5% — sivareddyg · 2026-09-09
- FrogNano 揭秘:自适应合成 RL 环境练出 4B 编程模型 — sivareddyg · 2026-09-09