可验证奖励 RL 为何不够:奖励信号太稀疏

helloiamleonie · x · 2026-09-25

作为 OPD 铺垫,Leonie 复习 RLVR(可验证奖励强化学习):训练模型做数学题时,从回答中提取最终答案与真值比对,据此给整条轨迹打分。这一方法效果不错,但奖励信号非常稀疏——整条轨迹只得到一个通过/不通过的信号,这正是引出逐 token 密集信号的 on-policy 蒸馏的动机。

所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →