类别感知专家训练框架:SWE-bench Multilingual 达 59%
Logics-MLLM · hf · 2026-09-22
论文提出软件工程 agent 的类别感知专家训练与策略整合框架。要点:
- 仓库级 SWE 任务类别异质,池化 agentic RL 常出现「跷跷板」:部分类别提升伴随其他类别回退,聚合解决率掩盖问题。
- 框架含可执行任务构建与 SWE Labeler(证据驱动的多轴标注系统)组织训练池。
- 同源类别专家交替进行长程 Agentic-miniRL 与 RRE(刷新-修复-扩展):用更新后的策略刷新实例、复用验证成功的轨迹做 Repair SFT、再选任务继续 RL。
- 标签路由的多教师 on-policy 蒸馏(MOPD)将专家整合为单个可部署学生模型,ReLU 门控奖励外推只保留各教师的改进方向;全程无需外部模型提供解法轨迹。
- 最终 MOPD 策略在 Pro-618 达 58.04%、SWE-bench Multilingual 达 59.00%,分别比基座模型高 5.39 和 2.78 个百分点。
「编程与Agent」频道最新
- 开发者开源 Google ADK 编程智能体技能集,覆盖部署与护栏实践 — Difficult_Design6676 · 2026-09-22
- 优化 Claude Code harness 一周,Max 20x 用量质量不减还富余 9 小时 — carlito_17 · 2026-09-22
- OpenAI 展示外科医生用 Codex 自建工具并检索 PubMed 文献 — OpenAIDevs · 2026-09-22
- 语义检索≠相关性:个人 Agent 记忆系统要拆开看的四层 — sujingshen · 2026-09-22
- JevHarness:LLM 自动生成决策 harness,冻结后极速执行 — sujingshen · 2026-09-22
- 文件优先的 Claude 项目 harness:11 个生命周期环节全设人工审批门 — bishopZ · 2026-09-22