RL 每条样本只给 1 bit,为何仍能有效训练 LLM?

camhowe1729 · x · 2026-09-23

Beren Millidge 发文讨论 LLM RL 的信息论悖论:预训练对每个 token 计算损失,而策略梯度式 RL 只在长达数十万 token 的 rollout 末尾拿到一个(常为二值的)标量奖励,摊下来每条样本只有 1/rolloutlength bit 信息;且 rollout 需要内存带宽受限的解码,比 prefill 更贵,奖励函数还常因格式小错而误判失败。

按这些论证,RL 应该极度低效、只能「引出」基座模型已有能力,但实证结果恰恰相反。文章尝试解释为何 RL 能突破这一表面上的信息瓶颈,并回应 Toby Ord 等人「RL 没有 enough bits」的质疑。帖子转发了这篇长文并询问 Toby Ord 是否更新了观点。

所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →