FLEET:用 MCTS 给采样加记忆,GSM8K 半数迭代即达基线
Helpful_Minimum_2214 · reddit · 2026-10-02
作者团队提出 FLEET 算法,让 Best-of-N 生成「记住」外部奖励:把高熵/高 varentropy 的 token 状态视为分支点,将归一化隐藏状态存入向量库并映射到含奖励历史的元数据,再用改进的 MCTS 对 top-k token 排序、惩罚次优分支,最后以修改后的 logits 解码。
在 Llama 3.2 3B 上的结果:
- GSM8K:多解出 7 题,且用一半迭代即达到采样基线。
- LiveCodeBench v6 easy:同预算下分数从 0.59 提到 0.69,仅 9 次迭代即达基线(基线需 32 次)。
方法无需串行执行——迭代中不更新,可直接作为查找表并行使用;元数据还可作为其他任务的先验或用于充实 SFT/RL。论文与代码均已开源。
「研究」频道最新
- OpenStamp:把水印写进权重末层,开源模型也能防删水印 — danish037 · 2026-10-03
- CruxBench 入选 NeurIPS:考「会不会提问」而非答对,前沿 LLM 仍难胜随机 — mengyer · 2026-10-03
- Lampinen 炮轰神经符号派:符号主张屡屡退让难以自洽 — AndrewLampinen · 2026-10-03
- 新研究:用语言数据解析人类衰老中的认知变化 — abenitezburraco · 2026-10-03
- 为何嵌入模型偏爱 1536 维?Reddit 探讨背后的取舍 — Gay-Guy-With-GF · 2026-10-03
- 半年用 AI 设计抗体与蛋白,研究者直言不信 AI 末日论 — CatAstro_Piyush · 2026-10-03