新研究探索推理时激活空间上的策略梯度推理

burny_tech · x · 2026-08-28

该帖子分享了一篇题为《Seek in the Dark》的论文,提出了一种在潜在空间的激活上而非权重上进行强化学习的方法。这种推理时实例级策略梯度为推理过程提供了新的优化视角。

所属事件:LatentSeek 在潜在空间强化推理超越思维链(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →