Thom Wolf 新讲座谈过优化、奖励黑客与逢迎

Thom_Wolf · x · 2026-07-26

一场更短的讲座,主题是过优化、奖励黑客、逢迎和冗长等问题。

Thom Wolf 说,这次内容主要是基础概念、历史脉络和一些反思。他在录制时意识到,rubric 也可能像 reward model 一样被过度优化,而 RLVR 本身又是另一回事。

讲座主要覆盖:

所属事件:专家讲座探讨大模型过优化与奖励黑客等失真问题(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →