Agent 训练新法:Designer 增加记忆与预训练采样,30B 模型涨点 10%
natashajaques · x · 2026-08-20
提出了一种改进 Reasoning Agent 训练的方法,针对传统“Designer”提出的任务多样性不足的瓶颈,通过赋予 Designer 记忆能力,并在每个 episode 中从大型预训练语料库采样作为条件来克服。
效果显示:
- 智能体性能随模型规模提升而改善。
- 在 30B 规模时,在 LiveCodeBench-v2、tau^2-bench 和 BFCL 等基准测试上比基础模型提升约 10%。
- 该方法能生成多样化、有趣且复杂度随训练增加的环境,可替代人工设计 RL 训练环境。
所属事件:Agent 训练新法:给任务设计者加记忆,30B 模型涨点 10%(2 条相关)→
「编程与Agent」频道最新
- Agent 后训练困境:首步锁定策略,缺乏中途反思机制 — omarsar0 · 2026-08-20
- 国内大厂客户端系统提示词泄露:三层记忆与 MCP 路由 — vista8 · 2026-08-20
- Addy Osmani:用 Agent 循环自动化审阅每日 90 个 PR — rseroter · 2026-08-20
- 一人公司利用 GPT-5.6 实现多 Agent 跨项目协作 — every · 2026-08-20
- ZenML 发布 Agent Trace Viewer,可视化调试代码智能体 — strickvl · 2026-08-20
- Claude Code + Opus 5 跑满 ARC-AGI-3,核心在可证伪预测 — scaling01 · 2026-08-20