RL 只能锐化已有能力?LLM 时代前的 RL 全是随机初始化训练

cephaloform · x · 2026-09-26

作者反驳一种流行观点:强化学习只能「锐化」模型中已存在的能力。他指出这在 LLM 时代之前根本站不住脚——彼时几乎所有 RL 都是在随机初始化的模型上训练出来的,能力显然是从训练过程中习得而非预先存在的。他还调侃说,「随机初始化包含所有可能能力」这个想法几乎带有诗意。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →