LLM 的 RL 明明信息低效,为何效果惊人?一篇深度思辨长文
nrehiew_ · x · 2026-09-12
beren.io 的一篇深度思辨文章,试图解释一个悖论:从信息论角度看,LLM 的强化学习应该极其低效,但实证效果却相反。
- 低效论:预训练对每个 token 计算损失,信息量大;策略梯度 RL 只在整个 rollout(可能几十万 token)末尾拿到一个标量奖励,信息量仅约 1/rolloutlength bit/样本
- 双重低效:rollout 需要自回归解码,受内存带宽限制,比 prefill 贵得多;且奖励函数往往粗糙,常因一个工具调用错误或漏写 \boxed 就判失败
- 谜题:既然如此,为何实践中 RL 效果远超预期,甚至能教会基座模型本不具备的行为?
文章作者自评「显然是推测性的」,值得关心 RL 训练本质的人一读。
「研究」频道最新
- Q2D-Web 基准发布:7 万 agent 查询评测 1.9 亿网页检索 — antoine_chaffin · 2026-09-12
- CMU 作者长文反驳 Coding is AGI:机器人任务撞墙说明世界模型不可缺 — ceciletamura · 2026-09-12
- 逆向工程还原苹果 Neural Engine 内部架构 — zdw · 2026-09-12
- SentencePiece 推出 Auto-character Coverage,替代字节级 BPE 的新方案 — prajdabre · 2026-09-12
- Hutter Prize 开放智能体群挑战,比拼终极压缩算法 — mervenoyann · 2026-09-12
- DeepMind Zahavy 用凸 MDP 论文回应「奖励非优化目标」之争 — TZahavy · 2026-09-12