RLVR是强化已有能力还是激发新推理?
burny_tech · x · 2026-07-20
探讨了强化学习(如 GRPO)在 LLM 中究竟是仅仅通过锐化分布来激发基础模型已有的能力,还是能真正涌现出全新的推理模式。作者指出,目前开源界仍缺乏具备严格对照实验和消融研究的大规模科学验证。不过,在 LLM 之前的传统神经网络领域,纯强化学习已被证实能发现全新的推理模式(伴随经典的 reward hacking 现象)。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21