RL 每条样本只给 1 bit,为何仍能有效训练 LLM?
camhowe1729 · x · 2026-09-23
Beren Millidge 发文讨论 LLM RL 的信息论悖论:预训练对每个 token 计算损失,而策略梯度式 RL 只在长达数十万 token 的 rollout 末尾拿到一个(常为二值的)标量奖励,摊下来每条样本只有 1/rolloutlength bit 信息;且 rollout 需要内存带宽受限的解码,比 prefill 更贵,奖励函数还常因格式小错而误判失败。
按这些论证,RL 应该极度低效、只能「引出」基座模型已有能力,但实证结果恰恰相反。文章尝试解释为何 RL 能突破这一表面上的信息瓶颈,并回应 Toby Ord 等人「RL 没有 enough bits」的质疑。帖子转发了这篇长文并询问 Toby Ord 是否更新了观点。
所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→
「漫话AGI」频道最新
- 经济学人:英国议会 10% 发言稿已由 AI 起草 — steverathje2 · 2026-09-24
- 图灵奖得主 Bengio 受邀向联合国安理会警示前沿 AI 智能体风险 — AndrewCritchPhD · 2026-09-24
- OpenAI 研究员 Boaz Barak:宁要人类掌舵,也不要仁慈的 AI 独裁者 — tszzl · 2026-09-24
- CNAS 发布 AGI 情景谱系报告:如何影响 AGI 未来走向 — paul_scharre · 2026-09-24
- 哲学家 Veliz:AI 主导并非定局,「未来不是被预测的,是被制造的」 — CarissaVeliz · 2026-09-24
- Karpathy 11 个月态度转变:从发明 vibe coding 到自叹大幅落后 — IgorCarron · 2026-09-24