给任务设计者加记忆与预训练语料采样,自动生成环境多样性大增
natashajaques · x · 2026-08-20
Natasha Jaques 介绍其团队工作:此类自动课程学习方法常因 Designer 提出的任务不够多样而受限。他们通过给 Designer 添加记忆、并让每个 episode 以预训练大语料中的样本为条件,克服了这一瓶颈。生成的训练环境多样且有趣,且随训练推进复杂度不断提升。
所属事件:Agent 训练新法:给任务设计者加记忆,30B 模型涨点 10%(2 条相关)→
「研究」频道最新
- 研究称大模型后期训练导致语言新颖但缺乏实用性 — TuhinChakr · 2026-08-20
- 合成 RL 环境新思路:一模型出题一模型玩,胜率居中成关键 — tokenbender · 2026-08-20
- Agent 后训练困境:首步锁定策略,缺乏中途反思机制 — omarsar0 · 2026-08-20
- GEN-1.5 爆火背后:重复性动作与 UM I 数据采集成关键 — DrJimFan · 2026-08-20
- NEJM 观点:AI 用于健康行为改变效果微小且难预测 — zakkohane · 2026-08-20
- Claude Code + Opus 5 跑满 ARC-AGI-3,核心在可证伪预测 — scaling01 · 2026-08-20