FLEET:用 MCTS 给采样加记忆,GSM8K 半数迭代即达基线

Helpful_Minimum_2214 · reddit · 2026-10-02

作者团队提出 FLEET 算法,让 Best-of-N 生成「记住」外部奖励:把高熵/高 varentropy 的 token 状态视为分支点,将归一化隐藏状态存入向量库并映射到含奖励历史的元数据,再用改进的 MCTS 对 top-k token 排序、惩罚次优分支,最后以修改后的 logits 解码。

在 Llama 3.2 3B 上的结果:

方法无需串行执行——迭代中不更新,可直接作为查找表并行使用;元数据还可作为其他任务的先验或用于充实 SFT/RL。论文与代码均已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →