可验证奖励 RL 为何不够:奖励信号太稀疏
helloiamleonie · x · 2026-09-25
作为 OPD 铺垫,Leonie 复习 RLVR(可验证奖励强化学习):训练模型做数学题时,从回答中提取最终答案与真值比对,据此给整条轨迹打分。这一方法效果不错,但奖励信号非常稀疏——整条轨迹只得到一个通过/不通过的信号,这正是引出逐 token 密集信号的 on-policy 蒸馏的动机。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「研究」频道最新
- 裸盖菇素改变脑活动时间结构,与主观体验相关 — adeelrazi · 2026-09-25
- 指数均值方差爆炸,Francis Bach 博客提出最小二乘补救方案 — BachFrancis · 2026-09-25
- 威廉玛丽学院 AI Frontier Lab 5 篇论文入选 NeurIPS — jindong_wang92 · 2026-09-25
- 人大团队开源 EvoOntology:为数据 Agent 构建自进化本体层 — JeremyCMorgan · 2026-09-25
- LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走 — helloiamleonie · 2026-09-25
- 把 Qwen3.8 的 n-gram 记忆移植进 0.8B 小模型,困惑度降 5.05% — Nicolodeva · 2026-09-25