RL 只能锐化已有能力?LLM 时代前的 RL 全是随机初始化训练
cephaloform · x · 2026-09-26
作者反驳一种流行观点:强化学习只能「锐化」模型中已存在的能力。他指出这在 LLM 时代之前根本站不住脚——彼时几乎所有 RL 都是在随机初始化的模型上训练出来的,能力显然是从训练过程中习得而非预先存在的。他还调侃说,「随机初始化包含所有可能能力」这个想法几乎带有诗意。
「研究」频道最新
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26
- Lawrence Krauss 播客探讨 AI 如何放大论文工厂的危害 — willcb · 2026-09-26
- 免微调让本地模型即时纠错:4096 原型池方案开源,NumPy+Java 实现 — thisdudelikesAI · 2026-09-26
- 开发者自建 ChatGPT 评测 harness,忧训练数据污染需出新题 — tak3sh8 · 2026-09-26
- 观点:按 flop 买智能,用自适应衰减换分布内精度 — willcb · 2026-09-26