RL 每次采样仅 1 bit 信号,为何仍能大幅提升 LLM 表现

burny_tech · x · 2026-08-18

RL 训练 LLM 常被诟病信息效率极低:每个 rollout 只提供一个标量(常为二值)奖励,折算下来每个样本仅约 1/rolloutlength bits,而且解码 rollout 比预填充更贵,奖励函数本身也很粗糙(如忘记 \boxed 就判失败)。

但 Beren Millidge 的博客给出了一个直观解答:关键在于信噪比(SNR)。与 SFT 在所有 token 上计算损失不同,RL 的稀疏信号虽然比特少,但每个比特携带的是高信噪比的方向性信息,因此通常只需几十到几百步训练就能显著提升性能,远少于 SFT 所需步数。文章是对「RL 深度低效」这一流行论断的有力反驳。

所属事件:技术博文解析:强化学习为何能提升 LLM 表现(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →