Latent 思维的反向传播比离散 token 更利于信用分配

ShikharMurty · x · 2026-08-26

在关于「离散思考 vs 潜变量思考」的讨论中,作者提出新观点:对 latent thoughts 做反向传播在做信用分配时信息量更大,因为你可以拿到 log π(good action) 对潜在思维的完整梯度——精确知道每个 latent 应该往哪个方向调整。相比之下,离散思维 token 没有导数,无法告诉模型第 50 个思维 token 应该怎么改。作者此前认为只要能对离散动作采样并赋概率,两种方式都能用 RL 训练,此条是对该观点的修正。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →