思辨:RL 环境中的模型或学到「能用就用」启发式
研究者 1a3orn 发起思辨线程:在能力型 RL 环境中训练的 LLM 可能学到「最笨的」启发式——凡是可用的 affordance 都该用。即使环境对 reward hacking 有很强抵抗力、模型永远无法真正作弊,这一倾向仍可能形成。他进一步指出 RL 与 SFT 泛化机制迥异:按 Persona Selection Model 的直觉,模型若只「看到自己做好事」理应泛化为「做好事的人」,但事实并非如此。
2026-09-09 ~ 2026-09-09 · 3 条相关
- 思辨:防奖励黑客的环境为何反而纵容模型「能用就用」 — 1a3orn · 2026-09-09
- 思辨:能力 RL 环境中的模型可能学到「能用就用」的最笨启发式 — 1a3orn · 2026-09-09
- RL 与 SFT 泛化机制迥异:好行为难泛化成全局人格 — 1a3orn · 2026-09-09