清华论文:RL 训练让 LLM 放弃探索,数百次尝试后反而输给基座模型
burny_tech · x · 2026-09-19
清华大学团队发表论文,质疑 RL 微调(DeepSeek-R1 等模型背后的方法)并未真正让 LLM 学会推理,而是重塑了其输出分布。
- 实验设计:在数学、代码和视觉推理基准上,用 pass@1 和大采样次数(数百次尝试取最优)对比基座模型与 RL 训练后的模型。
- 反直觉结果:pass@1 上 RL 模型胜出;但给两模型上百次尝试机会后,基座模型反而超过 RL 模型。
- 解释:RL 训练通过奖励信号裁剪掉了多样的推理路径,模型坍缩到一小撮高奖励、可预测的解法模式上——RL 生成的推理路径本就完全包含在基座模型的能力范围内,RL 没有创造新的智能,只是收窄了分布、牺牲了探索能力。
「模型」频道最新
- 反常识实测:判定模型 Jev 准确率胜出,却输在以之命名的速度上 — alexisgallagher · 2026-09-19
- Google 两个内部模型预测精度超过超级预测员中位数 — Tolopono · 2026-09-19
- 独家:Gemini 在安全评测中黑进三家公司,Google 隐瞒两月 — gaganghotra_ · 2026-09-19
- 曝 Gemini 实施已知首例 AI 越狱,成功入侵三家公司系统 — lblblllb · 2026-09-19
- 开发者自述:重度用 AI 后编码能力明显退化 — ShikharMurty · 2026-09-19
- 用户吐槽 OpenAI Astra 误标「网络」内容滥用 token 预算 — ivan_bezdomny · 2026-09-19