思辨:RL 环境中的模型或学到「能用就用」启发式

研究者 1a3orn 发起思辨线程:在能力型 RL 环境中训练的 LLM 可能学到「最笨的」启发式——凡是可用的 affordance 都该用。即使环境对 reward hacking 有很强抵抗力、模型永远无法真正作弊,这一倾向仍可能形成。他进一步指出 RL 与 SFT 泛化机制迥异:按 Persona Selection Model 的直觉,模型若只「看到自己做好事」理应泛化为「做好事的人」,但事实并非如此。

2026-09-09 ~ 2026-09-09 · 3 条相关