专家讲座探讨大模型过优化与奖励黑客等失真问题

Nat Lambert(Thom Wolf)近期开展讲座,深入探讨了人工智能中的过优化、奖励黑客、迎合性与冗长输出等问题。讲座回顾了 Goodhart 定律,并分析了为何 rubric 也会像 reward 一样被过度优化从而导致刷榜失真。主讲人表示,此次分享主要聚焦基础概念、历史脉络与相关反思,旨在帮助听众理解模型优化过程中的潜在陷阱。

2026-07-25 ~ 2026-07-26 · 3 条相关