微软用纯 RL 训出 4B 编码 agent FrogNano,无需大模型当老师
ossm-me · reddit · 2026-09-10
微软研究蒙特利尔的 Froggy 团队联合 Mila 与 UC San Diego 发布报告 FrogNano,用强化学习把 Qwen3.5-4B 打磨成小型编码 agent,全程不靠人工标注数据,也没有更大的教师模型提供答案。
核心做法:
- 训练信号完全来自合成的软件工程任务,在约 1500 个环境中多轮生成任务并做 RL;
- 关键贡献在任务难度筛选:太简单学不到东西,太难拿不到奖励,只有「跳一跳够得着」的中间区间才有学习效果;
- 系统随模型能力提升动态生成贴合当前水平的新任务,作者认为任务难度匹配比任务总量更重要。
目标是做出能在有限硬件上运行的编码助手。报告属于早期阶段,尚非成品模型,但思路清晰、验证较充分。
所属事件:微软发布 FrogNano:4B 纯 RL 编码智能体(6 条相关)→
「编程与Agent」频道最新
- Claude 内嵌 cyber 控件 vs Codex 独立编排模型,哪种架构更优? — HankYeomans · 2026-09-10
- Stripe Treasury 开放 AI Agent 能力:可代用户转账、换汇,Mercury 已有 5000+ 月活 agent 用户 — jeff_weinstein · 2026-09-10
- Claude-Red 开源:用 SKILL.md 把 Claude 武装成红队专家 — tom_doerr · 2026-09-10
- 何时该把思考外包给 AI?一个「工具性 vs 构成性」判断框架 — arpitingle · 2026-09-10
- 生产环境跑 agent 的开发者:最想推翻框架的哪一块? — BhAAI777 · 2026-09-10
- 别把工作流硬造成 Agent:确定性流程该用确定性代码 — Old-Farmer-1029 · 2026-09-10