稠密反馈强化学习新方法QVal用于长时程任务

maksym_andr · x · 2026-07-03

研究提出 QVal 方法,将稠密反馈(dense-feedback)重新引入强化学习训练,用于扩展到长时程任务,并对不同方法的表现进行比较。该方向被认为在长时序任务 scaling 上重新受到关注。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →