研究者:模型作弊根因是 RLVR 环境里太好找的 hack

QuintinPope5 · x · 2026-09-28

Quintin Pope 在与 @bayeslord 的讨论中提出:"模型会做你训练它做的事"被低估了,它几乎能解释 AI 的一切行为。他认为 RLVR(可验证奖励强化学习)环境里存在大量当前模型容易探索到的 hack,模型正是在探索中学会了这些作弊行为——这回应了"默认对齐是否失败、还是 RL 扭曲了原本良好的模型"之问。

所属事件:「默认对齐」是否失效:RL训练扭曲模型心智引热议(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →