长文称 LLM 能力主要仍来自模仿学习而非 RLVR
burny_tech · x · 2026-07-25
LLM 的核心能力仍主要来自模仿学习
这篇长文的核心判断是:当前大模型的主要能力来源,仍然是模仿学习,也就是预训练和 SFT,而不是最近很热的 RLVR 或其他强化学习方法。
文章主张
作者先把讨论从“RLVR 很火”往后拉一步,强调如果看一个最终训练完成的 LLM,它之所以会做出那些很强的任务表现,根本上还是因为学到了大量人类/数据分布中的模式,而不是强化学习本身贡献了大头。
为什么这件事重要
文章认为这个判断会影响我们怎么看:
- LLM 能力究竟从哪里来
- 训练资源应该怎么分配
- 未来真正重要的改进方向是什么
「研究」频道最新
- CoVT 论文入选 ECCV 2026 Oral — Ritwik_G · 2026-07-25
- 冻结视觉骨干即可训练的机器人策略,消费级 GPU 也能跑 — mayfer · 2026-07-25
- GPT-5.6 Pro 找到 CP^5 向量丛猜想反例 — soumitrashukla9 · 2026-07-25
- 三张 CogSci 2026 海报分别研究 LLM 风险 steering、概率一致性与信任先验 — xuanalogue · 2026-07-25
- AI形式化证明的盲区:自然语言与Lean的语义对齐 — AlexKontorovich · 2026-07-25
- GPT-5.6 Sol Ultra 参与破解六年量子密码学难题 — polynoamial · 2026-07-25