仅 4B 参数纯 RL 训练,FrogNano 声称达成仓库级编程能力
burkov · x · 2026-09-10
FrogNano 项目展示了一个紧凑的 40 亿参数模型,仅靠在合成任务上做强化学习就能达到较强的仓库级编程性能,无需从更大模型蒸馏,意在降低前沿 SWE agent 的成本与部署门槛。
核心方法:
- TaskPilot:在线任务合成系统,从真实仓库快照生成并迭代打磨可执行的软件工程任务,难度校准到当前策略的「可学习边界」。
- Leaf:轻量 agent 执行框架,只配五个带类型的工具加简单的终止规则。
- 训练:以 Qwen3.5-4B 为基座,用 group-relative DPPO,经五轮连续的任务合成-训练迭代。
所属事件:微软 FrogNano:4B 模型纯 RL 训练拿下 SWE-bench 61.5%(5 条相关)→
「编程与Agent」频道最新
- Salesforce 发布 EvoHarnessBench:考验 Agent 应对工具与环境持续演进 — Salesforce · 2026-09-10
- 清华+Qwen团队:重建代码环境训练Agent,Terminal-Bench提升至58.1% — rohanpaul_ai · 2026-09-10
- 网友呼吁:让 Codex/Claude 沉淀流程文档,防模型哪天不可用 — moonsandhues · 2026-09-10
- 开源 Whatomate:单二进制 WhatsApp AI 客服平台获 1.5k Star — tom_doerr · 2026-09-10
- Reddit 网友用 Kanban 看板管理 AI 子代理,彻底解决上下文膨胀 — Clean-Vermicelli-700 · 2026-09-10
- 开源 Nomos 项目:如何系统性测试 AI 代理权限是否过宽 — Excellent-Hour7253 · 2026-09-10