长文称 LLM 能力主要仍来自模仿学习而非 RLVR

burny_tech · x · 2026-07-25

LLM 的核心能力仍主要来自模仿学习

这篇长文的核心判断是:当前大模型的主要能力来源,仍然是模仿学习,也就是预训练和 SFT,而不是最近很热的 RLVR 或其他强化学习方法。

文章主张

作者先把讨论从“RLVR 很火”往后拉一步,强调如果看一个最终训练完成的 LLM,它之所以会做出那些很强的任务表现,根本上还是因为学到了大量人类/数据分布中的模式,而不是强化学习本身贡献了大头。

为什么这件事重要

文章认为这个判断会影响我们怎么看:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →