思辨:能力 RL 环境中的模型可能学到「能用就用」的最笨启发式

1a3orn · x · 2026-09-09

1a3orn 发起一条推测性线程:假设一个在能力型 RL 环境中训练的 LLM 学到了「最笨的可能」启发式——即使环境对 reward hacking 有很强抵抗力,它也可能学到「凡是可用的 affordance 就该用」。作者随后补充核心论点:局部的好行为并不能泛化为全局的好行为,RL 泛化与理想 RL 环境设计之间存在某种奇怪的张力。属于对 RL 训练动态与安全性的开放性思辨,无实验数据。

所属事件:思辨:RL 环境中的模型或学到「能用就用」启发式(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →