Progressive Point Matching:为长程 RL 轨迹逐 token 分配信用的新方法
kvfrans · x · 2026-09-09
- 问题:当前 LLM RL 普遍使用稀疏结果奖励(轨迹成败给 0/1),但随着任务扩展到数百万乃至数十亿 token 的长程任务,其效率急剧下降——理论上,策略梯度的信噪比随任务视野呈指数级衰减;几十个子任务都完成、只败在最后一步的轨迹与毫无进展的轨迹拿到相同奖励。
- 现有替代方案的缺陷:学习值函数、过程奖励、自蒸馏等密集奖励方法会引入渐近偏差,最优策略在替代目标下可能偏离真正最优,例如过程奖励会激励模型说出逻辑正确但与任务成败无关的表述。
- PPM 方法:介于 RL 与模仿学习之间,对长轨迹提供简单、渐近无偏的部分信用分配,可为每个 token 分配密集信用。作者称在长程任务上训练效率相比标准 GRPO 有指数级提升。
- 作者 Preston Fu 与 kvfrans(Google 研究团队)等人合作,已发布博客文章。
「研究」频道最新
- OpenAI 宣称 AI 攻克纳维-斯托克斯问题,却被指抢发学者成果 — GaryMarcus · 2026-09-09
- Noam Brown 力挺:千禧年难题冲刺耗资数百万,但 test-time 算力成本一年降数万倍 — anshulkundaje · 2026-09-09
- 航天工程教授泼冷水:AI「解出」N-S被严重夸大 — Mindrust · 2026-09-09
- 数学界应立新规:重大证明须附 LLM 对话记录,否则无法署名 — rbhar90 · 2026-09-09
- Marin 社区实验:YOCO 变体复用中点激活替代 KV,有效加速达 1.12 倍 — liliang_ren · 2026-09-09
- DeepMind 发布 AlphaGenome Atlas:预测全基因组 90 亿个变异的调控影响 — anshulkundaje · 2026-09-09