Byrnes称LLM核心能力仍来自模仿学习

Steven Byrnes 在长文中提出,当前大模型的核心能力主要仍来自预训练与监督微调等模仿学习,而不是近期备受关注的 RLVR 及其类似强化学习方法。按这一判断,强化学习并非无用,但更多是在调动、筛选和打磨模型已通过模仿学习形成的能力。

2026-07-25 ~ 2026-07-26 · 2 条相关