Agent 训练新法:给任务设计者加记忆,30B 模型涨点 10%
Natasha Jaques 团队提出改进 Reasoning Agent 训练的新方法。自动课程学习常因任务设计者(Designer)提出的任务多样性不足而受限,他们通过给 Designer 添加记忆能力,并在每个 episode 对预训练语料进行采样,显著提升自动生成环境的多样性,最终使 30B 模型性能提升约 10%。
2026-08-20 ~ 2026-08-20 · 2 条相关
- 给任务设计者加记忆与预训练语料采样,自动生成环境多样性大增 — natashajaques · 2026-08-20
- Agent 训练新法:Designer 增加记忆与预训练采样,30B 模型涨点 10% — natashajaques · 2026-08-20