dots3-note 测试时学习与 TEMPO 自评机制解析

dots3-note Preview 展示了测试时学习能力:在陌生环境中通过交互探索、形成并检验假设、更新记忆、纠正过时假设并复用经验,作者称该行为还泛化到了未训练过的游戏《Slay the Spire》。针对长程任务奖励稀疏问题,dots3-note 采用 TEMPO 递归自评机制,将长达数十小时的 rollout 轨迹切分为宏步骤并提供过程奖励,使模型知道哪些动作真正有效。

2026-08-30 ~ 2026-08-30 · 2 条相关