dots3-note 测试时学习与 TEMPO 自评机制解析
dots3-note Preview 展示了测试时学习能力:在陌生环境中通过交互探索、形成并检验假设、更新记忆、纠正过时假设并复用经验,作者称该行为还泛化到了未训练过的游戏《Slay the Spire》。针对长程任务奖励稀疏问题,dots3-note 采用 TEMPO 递归自评机制,将长达数十小时的 rollout 轨迹切分为宏步骤并提供过程奖励,使模型知道哪些动作真正有效。
2026-08-30 ~ 2026-08-30 · 2 条相关
- TEMPO 递归自评:把数十小时轨迹切成宏步骤做过程奖励 — SarahAnnabels · 2026-08-30
- dots3-note 测试时学习:未知环境中自我纠错并复用经验 — SarahAnnabels · 2026-08-30