研究员称 RL 评估门槛已提高:reward hacking 太多,标准收紧

tszzl · x · 2026-09-15

网友 tszzl 回应讨论时表示:过去可能被接受的 RL 训练标准今天已不再合理——reward hacking 现象太多,评估门槛已经提高。他补充称模型在多个方面已大幅进步,「更多内容将很快公布」,暗示相关方法或结果即将公开。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →